RAG(Retrieval-Augmented Generation,检索增强生成) 是一种让大语言模型(LLM)在回答问题时,先去外部知识库检索相关信息,再组织答案的技术架构。
一句话总结:给大模型装了一个"知识外挂"。
基本架构
用户提问 → [Retrieval 检索] → 外部知识库 → 拼装到 Prompt → [Generation 生成] → 回答
- Retrieval(检索):把用户问题向量化,去知识库做语义相似度匹配,取回最相关的若干片段(chunks)
- Generation(生成):把检索到的内容拼进 Prompt,让 LLM 基于"被喂进来的真实资料"作答
(详细流程见 RAG运转流程)
RAG 解决的三类核心问题
LLM 自身存在三个结构性短板,RAG 是当下最主流的缓解方案:
| 问题 | 含义 | RAG 的解法 |
|---|---|---|
| 截断 | 知识时效性:模型训练数据有截止日期,最新的事不知道 | 把最新资料放进知识库,检索时即时取用 |
| 未知 | 私有数据:企业内部文档、个人资料模型从未见过 | 把私有数据向量化入库,专属可查 |
| 幻觉 | 模型幻觉:在不知道答案时倾向于"自信地编" | 用检索到的真实资料约束生成,让模型有据可依 |
常见落地场景
| 场景 | 典型形态 | 知识库来源 |
|---|---|---|
| 智能客服 | 基于 FAQ、售后政策、产品手册的自动答疑 | 客服历史、产品文档、政策条款 |
| 企业知识管理 | 接入 Confluence、飞书、PDF、Word,建成统一 AI 知识库 | 企业内部文档系统 |
| 教育培训 | 把讲义、课件、题库、视频字幕构建为学习助手 | 课程资料、习题、答疑记录 |
| 医疗辅助与智能诊断 | 整合医学文献、临床指南、电子病历,辅助医生诊断决策 | 文献库、指南、患者数据 |
医疗场景对 RAG 的"有据可查"特性尤其关键 —— 不能幻觉、必须可追溯。
与原生 LLM 的关系
RAG 不修改模型本身,是在推理时通过 Prompt 注入外部知识。这让它具备:
- 快速更新:知识库换一份内容,模型行为立刻跟着变,不用重新训练
- 成本低:相比微调(Fine-tuning)便宜得多
- 可追溯:每条回答可以引用检索到的原文出处
代价是:检索质量直接决定回答质量,"垃圾进、垃圾出"在 RAG 里同样适用。
PM 怎么用 / 何时用
- 当需求涉及"答最新的事、答企业私有资料、不能幻觉"时,对照截断/未知/幻觉三类问题,判断是否该上 RAG 而非微调。
- 方案设计时,先确认知识库来源(客服历史/企业文档/课件/文献),再定场景形态——知识库决定了产品能答什么。
- 验收回答质量出问题时,先查检索质量("垃圾进垃圾出"),别急着归因到模型。
相关页面
→ RAG运转流程 → 六大成熟AI应用场景 → 大模型预训练 → AI工程集成 → RAG落地操作指南(可执行版) → AIPM课程 Day6