后训练(Post-training)是指在预训练完成后,通过额外的数据处理或模型优化手段,进一步提升大模型性能或适应性的技术阶段。其核心目标是弥补预训练的不足,使模型更贴近实际应用需求。
后训练是大模型从"通才"变为"专才"的核心桥梁,本质是通过数据驱动和算法干预,在预训练的"粗糙毛坯"上进行精细化雕琢。
主要方法
SFT(有监督微调 / Supervised Fine-Tuning):通过部分优质标注数据精准微调,让 AI 学习人类特定对话任务的交流方式,高效全面提升模型各任务的表现能力。
RLHF(基于人类反馈的强化学习 / Reinforcement Learning from Human Feedback):以强化学习方式依据人类反馈优化语言模型,用人的偏好(反馈)对模型整体输出结果进行训练。
- 训练过程:收集人类偏好数据(数万次对话)→ 训练奖励模型(Reward Model,学习人类判断规律)→ 最终大模型(几百万次对话强化学习)
- 目标:训练奖励模型,通过奖励模型实现大模型的自主学习能力
强化学习(RL):让模型通过环境反馈(奖励 / 惩罚)自主优化策略。
技术路线组合
| 技术路线 | 代表产品 |
|---|---|
| SFT + RLHF | ChatGPT |
| SFT + Constitutional AI | Claude |
| SFT + DPO | Zephyr 等 |
| 领域继续预训练 + 领域 SFT | 医疗 / 法律垂直模型 |
| 纯强化学习(少人工标注) | DeepSeek |
案例一:Claude Constitutional AI
技术路线:预训练 + SFT + Constitutional AI
流程:
- 制定原则集(规范:回答应诚实、无害、有帮助)
- AI 生成初始回答
- AI 依据原则集自我批评(这个回答违反了哪条原则?)
- AI 修订回答
- 生成偏好数据对(原始回答 vs 修订回答)
- 训练奖励模型,然后用做强化学习
与标准 RLHF 核心差异:人类只需要制定原则,不需要对每个回答逐一打分。
案例二:DeepSeek-R1 训练流程
基于 DeepSeek V3(Base Model):
- 第1阶段:SFT(数千条样本数据)→ Checkpoint
- 第2阶段:强化学习(推理能力)→ Checkpoint
- 第3.1阶段:生成新 SFT 数据
- 第3.2阶段:SFT(800k 条推理数据 + 200k 条非推理数据)→ Checkpoint
- 第4阶段:强化学习 → DeepSeek R1
相关页面
→ 大模型预训练 → 大模型发展时间线 → AIPM课程 Day3