后训练(Post-training)是指在预训练完成后,通过额外的数据处理或模型优化手段,进一步提升大模型性能或适应性的技术阶段。其核心目标是弥补预训练的不足,使模型更贴近实际应用需求。

后训练是大模型从"通才"变为"专才"的核心桥梁,本质是通过数据驱动和算法干预,在预训练的"粗糙毛坯"上进行精细化雕琢。

主要方法

SFT(有监督微调 / Supervised Fine-Tuning):通过部分优质标注数据精准微调,让 AI 学习人类特定对话任务的交流方式,高效全面提升模型各任务的表现能力。

RLHF(基于人类反馈的强化学习 / Reinforcement Learning from Human Feedback):以强化学习方式依据人类反馈优化语言模型,用人的偏好(反馈)对模型整体输出结果进行训练。

  • 训练过程:收集人类偏好数据(数万次对话)→ 训练奖励模型(Reward Model,学习人类判断规律)→ 最终大模型(几百万次对话强化学习)
  • 目标:训练奖励模型,通过奖励模型实现大模型的自主学习能力

强化学习(RL):让模型通过环境反馈(奖励 / 惩罚)自主优化策略。

技术路线组合

技术路线 代表产品
SFT + RLHF ChatGPT
SFT + Constitutional AI Claude
SFT + DPO Zephyr 等
领域继续预训练 + 领域 SFT 医疗 / 法律垂直模型
纯强化学习(少人工标注) DeepSeek

案例一:Claude Constitutional AI

技术路线:预训练 + SFT + Constitutional AI

流程:

  1. 制定原则集(规范:回答应诚实、无害、有帮助)
  2. AI 生成初始回答
  3. AI 依据原则集自我批评(这个回答违反了哪条原则?)
  4. AI 修订回答
  5. 生成偏好数据对(原始回答 vs 修订回答)
  6. 训练奖励模型,然后用做强化学习

与标准 RLHF 核心差异:人类只需要制定原则,不需要对每个回答逐一打分。

案例二:DeepSeek-R1 训练流程

基于 DeepSeek V3(Base Model):

  1. 第1阶段:SFT(数千条样本数据)→ Checkpoint
  2. 第2阶段:强化学习(推理能力)→ Checkpoint
  3. 第3.1阶段:生成新 SFT 数据
  4. 第3.2阶段:SFT(800k 条推理数据 + 200k 条非推理数据)→ Checkpoint
  5. 第4阶段:强化学习 → DeepSeek R1

相关页面

大模型预训练大模型发展时间线AIPM课程 Day3