AIPM 课程第八天,主题是 RAG 在线检索生成,承接 Day7 的离线知识库,讲用户提问到最终答案的 4 个在线 Pipeline。

授课结构

主题 对应概念页
RAG 在线总览 RAG运转流程
Pipeline1 Query 向量化 + Query 增强/改写 Query增强与改写
Pipeline2 向量检索 + Pipeline3 上下文组装 + Pipeline4 生成 RAG检索-组装-生成

串联逻辑

用户的一句"人话"要变成系统可执行的检索 + 生成,必须经过 4 步翻译:

口语化 Query → 改写/增强成精准检索词 → 多路召回 + 重排序漏斗 → 拼装成结构化 Prompt → LLM 生成并后处理

每一步都在"对齐用户意图"和"控制工程成本"之间找平衡:Query 增强决定召回上限,重排序决定 TOP-K 的质量,Prompt 模板决定生成的可控性,后处理决定能不能直接交付给前端。

课堂笔记要点

  • Query 改写两条路线:seq2seq(指针生成网络,速度快但效果一般) vs Few-Shot + CoT(基于大模型,准确率高但贵)——选型按"延迟预算"和"成本预算"决定。
  • 召回是漏斗,不是查询:百万级全量 → 万级粗排候选 → 千级粗排 → 几十级精排 → TOP 5-10。每一层用不同复杂度的模型,是工程降本的核心结构。
  • 多路召回必须合并去重:用哈希表(key = 文档唯一标识,value = 整合信息),保留得分/内容/召回路径,避免重复 chunk 浪费 token。
  • Prompt 5 段结构是工业级模板:System Prompt(角色+规则+风格)/ Reference Context(检索资料)/ Conversation History(历史对话)/ User Query(当前问题)/ Output Format(输出格式)。
  • 面试真题"RAG 怎么有效降低成本":用二级片段法——chunk 分二级结构,先用小片段做 embedding 检索,Top-K 命中后用其归属的大片段做替换,独立小片段不输出。同时保证检索精度和上下文完整度。
  • 生成阶段的模型选型不是单一模型:route_model 按 Query 类型分流——空召回走小模型、需计算走 Tool、follow-up 走中等、复杂问题走大模型,是控制成本的关键一环。
  • 流式输出 4 要点:首字延迟 < 1s(核心指标)/ 中断处理(用户离开页面要能取消)/ 错误处理(流到一半挂了前端要有"重试")/ 完整性校验(流结束后要 parse 校验,比如 JSON 是否完整)。
  • 后处理决定能否交付前端:引用关联([doc-N] → 可点击锚链接)、Markdown 渲染、敏感词/PII 过滤、格式校验(不合规走兜底逻辑)。

相关页面

Query增强与改写RAG检索-组装-生成RAG运转流程AIPM课程 Day7提示词设计五要素(Prompt 模板是 RTCC 的进阶工业版) → 提示词工程四象限法则模型选型方法论(生成阶段的 route_model 是其落地形态)