AIPM 课程第七天,主题是 RAG 离线知识库构建,把"原始资料"变成"可被检索的向量库"的端到端 6 个 Pipeline。

授课结构

主题 对应概念页
RAG 总体运转 RAG运转流程
Pipeline1 数据采集 RAG数据采集
Pipeline2 文档解析 RAG文档解析
Pipeline3 数据清洗 + Pipeline4 文本分割 RAG数据清洗与文本分割
Pipeline5 文本向量化 + Pipeline6 向量索引构建 RAG向量化与索引

串联逻辑

整条离线流水线的核心是把"非结构化的原始内容"加工成"语义可检索的向量单元":

原始资料 → 解析成纯文本 → 清洗掉噪声 → 切成语义完整的 chunk → 用 embedding 模型映射成向量 → 写入向量索引

每一步都决定下一步的上限:采集决定知识边界,解析决定语义保真度,清洗决定召回噪声,分割决定语义粒度,向量化决定相似度的"标尺",索引决定线上响应速度。

课堂笔记要点

  • 每个 Pipeline 都按"PM 职责 + 协作对象 + 面试真题"三件套讲,这是 RAG 课程贯穿的结构。
  • 分割是 RAG 上限的瓶颈:老师强调"语义边界优先、长度适配模型、重叠窗口兜底"是三大铁律,硬切语义单元一定会拉低召回。
  • GIGO + 数据溯源贯穿全程:每个 chunk 必须带 doc_id,最终答案要能回溯到来源段落,这是产品端"可追溯回答"的工程前提。
  • 数据来源三分法:企业内部(历史文档/业务系统/在线知识库/FAQ/邮件)、外网公开(爬虫/API/公开数据集)、付费外采(行业报告/专业数据库/第三方知识服务)——决定知识库的边界和合规性。
  • 复杂排版(多栏、跨栏表格、图文穿插)的阅读顺序问题是面试高频题,目前两类方案:版面分析+规则排序(快但难处理复杂) vs 按顺序生成文本(顺序好但性能差)。
  • 二级片段法是降本的代表手法:先用小片段做 embedding 检索,命中后用其归属的大片段做替换上下文,兼顾召回精度和上下文完整度。

相关页面

RAG运转流程RAG数据采集RAG文档解析RAG数据清洗与文本分割RAG向量化与索引六大成熟AI应用场景(其中 RAG 知识库即本课程对象) → 数据准备五环节(Day2 的数据准备框架在 RAG 中具象化为本课流程) → 提示词设计五要素(Prompt 部分在 Day8 展开)