RAG 离线 Pipeline 1(全景):圈定知识库边界,把原始资料按"所有权"和"接入方式"双维度采集进来。

三大数据来源(按所有权划分)

来源 典型内容 特点
企业内部 历史文档(合同/制度/项目技术文档/培训手册)、业务系统数据(ERP/CRM/OA/HR 结构化或半结构化)、在线文档与知识库(飞书/语雀/阿里云百炼)、FAQ 与客服记录、邮件与通讯记录(IM、会议纪要) 私有、合规可控、质量高,是企业知识库主力
外网公开 网页爬虫(行业网站/政府公开数据/百科/新闻/论坛)、API 接口(天气/地图/财经/法律开放 API)、公开数据集(Kaggle/政府数据平台/行业报告库) 覆盖广但噪声多,需注意版权与合规
付费外采 行业报告(艾瑞、易观、德勤)、专业数据库(Wind、Bloomberg、知网、万方)、第三方知识服务(法律条文库、标准库、专利库) 权威但成本高,适合高价值垂直场景

三大技术接入方式

接入方式 适用场景 核心要点
文件类接入 本地文件夹、网盘、云存储中的 Word/PDF/Excel 统一解析格式、识别编码,把非结构化文件变成可处理的文本流
数据库接入 业务数据库或数据仓库 增量拉取(依赖时间戳或变更日志 CDC)+ 定时批量抽取;核心是保证数据同步性和及时性
API 接入 调外部 REST/GraphQL,或接收对方 Webhook 回调 处理认证、限流、失败重试和幂等去重

采集原则

只采集与业务场景强相关的数据,同时记录数据来源。

  • 减少噪声:与业务场景无关的数据进入向量库只会拉低召回质量。
  • 强制带元数据:每条数据必须记录来源 ID、采集时间、所有权类型,为后续检索过滤、答案引用和合规审计兜底。

PM 此阶段职责

  1. 基于业务场景定义知识边界。
  2. 协调业务方提供核心数据源,明确数据优先级。
  3. 联合法务专员审核数据版权与合规性(如公开网页数据的使用权限)。
  4. 制定数据来源标注规范,确保后续检索结果可溯源。

协作对象:数据采集负责人、业务部门接口人、法务专员。

面试真题

  • 你们项目中的数据来源有哪些?
  • 你们的数据量级是多大?

相关页面

RAG运转流程RAG文档解析数据准备五环节AIPM课程 Day7