RAG 离线 Pipeline 1(全景):圈定知识库边界,把原始资料按"所有权"和"接入方式"双维度采集进来。
三大数据来源(按所有权划分)
| 来源 | 典型内容 | 特点 |
|---|---|---|
| 企业内部 | 历史文档(合同/制度/项目技术文档/培训手册)、业务系统数据(ERP/CRM/OA/HR 结构化或半结构化)、在线文档与知识库(飞书/语雀/阿里云百炼)、FAQ 与客服记录、邮件与通讯记录(IM、会议纪要) | 私有、合规可控、质量高,是企业知识库主力 |
| 外网公开 | 网页爬虫(行业网站/政府公开数据/百科/新闻/论坛)、API 接口(天气/地图/财经/法律开放 API)、公开数据集(Kaggle/政府数据平台/行业报告库) | 覆盖广但噪声多,需注意版权与合规 |
| 付费外采 | 行业报告(艾瑞、易观、德勤)、专业数据库(Wind、Bloomberg、知网、万方)、第三方知识服务(法律条文库、标准库、专利库) | 权威但成本高,适合高价值垂直场景 |
三大技术接入方式
| 接入方式 | 适用场景 | 核心要点 |
|---|---|---|
| 文件类接入 | 本地文件夹、网盘、云存储中的 Word/PDF/Excel | 统一解析格式、识别编码,把非结构化文件变成可处理的文本流 |
| 数据库接入 | 业务数据库或数据仓库 | 增量拉取(依赖时间戳或变更日志 CDC)+ 定时批量抽取;核心是保证数据同步性和及时性 |
| API 接入 | 调外部 REST/GraphQL,或接收对方 Webhook 回调 | 处理认证、限流、失败重试和幂等去重 |
采集原则
只采集与业务场景强相关的数据,同时记录数据来源。
- 减少噪声:与业务场景无关的数据进入向量库只会拉低召回质量。
- 强制带元数据:每条数据必须记录来源 ID、采集时间、所有权类型,为后续检索过滤、答案引用和合规审计兜底。
PM 此阶段职责
- 基于业务场景定义知识边界。
- 协调业务方提供核心数据源,明确数据优先级。
- 联合法务专员审核数据版权与合规性(如公开网页数据的使用权限)。
- 制定数据来源标注规范,确保后续检索结果可溯源。
协作对象:数据采集负责人、业务部门接口人、法务专员。
面试真题
- 你们项目中的数据来源有哪些?
- 你们的数据量级是多大?
相关页面
→ RAG运转流程 → RAG文档解析 → 数据准备五环节 → AIPM课程 Day7