
Lecture 5:LLM Preference tuning
系统梳理大语言模型偏好调优(Preference Tuning)的核心技术与方法,涵盖偏好数据的三大类型(点态/成对/列表型)与获取流程、RLHF两阶段架构(奖励建模+PPO强化学习)、BoN替代方案,以及DPO的数学原理与优势,最后对比RLHF与DPO的实现难度与性能差异。
阅读文章ZHY's Blog
A UNIVERSE OF IDEAS · BY ZHANG HAOYI
让好奇心 点亮知识宇宙
在代码、模型与思想之间自由漫游。这里持续记录人工智能、机器学习、软件工程与成长实践,让每次阅读都成为一次新的发现。
ARTICLE NOTE
有限推理(Limited reasoning):仅能进行“表层模式匹配”,无法拆解复杂问题的逻辑链路(如多步数学计算、逻辑推理)
知识静态化(Knowledge is static):预训练数据存在“时间截止点”,无法实时更新(如2024年训练的模型不知道2025年的事件),且无法主动获取新信息
无法执行动作(Cannot perform actions):仅能生成文本输出,无法与外部工具(如计算器、数据库、API)交互,因此面对需要工具辅助的推理任务(如复杂数据统计、图表分析),模型无法完成。
难以评估(Hard to evaluate):推理正确性的量化指标缺失,传统“困惑度(Perplexity)”仅能衡量文本流畅性,无法判断推理逻辑的有效性;

图1 推理模型
(1)推理定义:Reasoning = Ability to solve a problem(通过逻辑推导、计算、步骤拆解解决问题的能力)
(2)形式化区分:
非推理(Not reasoning):输出仅依赖“预训练知识提取”,无中间推导过程,数学表示为 Output=f(Input,Knowledge) ;
推理(Reasoning):输出依赖“输入+知识+推导步骤”,数学表示为 Output=f(Input,Knowledge,Reasoning Chain) ;
实例对比:
| 非推理(Not reasoning) | 推理(Reasoning) |
|---|---|
| 问题:斯坦福Transformer&LLM课程的课程代码是什么? 逻辑:直接从预训练知识中提取答案 | 问题:小熊2020年出生,现在几岁? 逻辑:输入(2020年出生)→ 知识(当前年份2025)→ 推导(2025-2020=5)→ 答案(5岁) |
核心思想:让模型在输出答案前,先生成“逐步推理的自然语言文本”(思维链),将复杂问题拆解为可执行的子步骤。
(1)传统LLM范式(黑箱输出):Question→LLM→Answer
(2)推理模型范式(透明推导):Question→LLM→Reasoning Chain→Answer
推理模型的进阶方向:不仅在小样本提示中使用CoT,更通过预训练、微调、强化学习让模型“主动生成高质量CoT”,而非依赖人工设计的提示模板。
关键目标:让模型学会“自主拆解问题”,例如面对“复杂方程求解”,能自动生成“移项→化简→求解→验证”的推理链。
推理模型与传统LLM的三大显著差异,可通过用户交互界面直接识别:
思考阶段可视化:
推理链完整性:
推理链默认隐藏:
推理模型的计费核心是“推理token计入输出成本”,这是由其“推理链+答案”的输出结构决定的:
评估推理模型的核心是“可验证的推理任务”,即任务结果有明确的“正确/错误”判定标准,课件分为两大核心类别:
(1)任务类型:解决编程问题、修复bug、代码优化;
(2)核心要求:模型生成的代码需通过所有测试用例(Test Cases),推理链需包含“问题分析→算法选择→代码实现→测试验证”步骤;
(3)代表数据集:
(1)任务类型:解决复杂数学问题(如奥数、竞赛题、代数方程);
(2)核心要求:模型需生成“逐步推导过程”,最终答案需与标准答案一致;
(3)代表数据集:
数据结构:每个样本包含“问题(Problem)→ 推理链(Reasoning Chain)→ 答案(Answer)→ 验证用例(Test Cases)”;
难度梯度:从简单(1步推理)到复杂(10+步推理),覆盖不同推理能力层级;
评估方式:客观自动评估(代码通过测试用例、数学答案匹配),无主观偏差。
作为推理模型核心指标,Pass@k定义为在k次独立生成尝试中,至少有1次成功解决问题的概率。
(1)前提假设:设总尝试次数为n,其中成功次数为c,失败次数为n-c;每次尝试独立,成功概率为p,失败概率为1-p。
(2)公式推导:
(3)特殊情况:Pass@1(单次生成成功的概率),公式简化为: Pass@1=nc ,直接反映模型的“单次推理准确率”。
(1)定义:对k次生成结果进行“多数投票”,若投票结果与真值一致,则判定为成功;
(2)数学表示: Cons@k=P(majority(A1,A2,...,Ak)=Ground Truth) ;
(3)优势:降低单次生成的随机性影响,更适合评估“高风险推理任务”(如医疗诊断、金融分析)。
(1)影响因素:

图2 Pass@K与K,T的关系
如图所示,当k从1增至100时,Pass@k从0.1提升至0.4(T=1.0),而T=0.0时仅提升至0.2。
(2)适用场景:
(1)测试时扩展(Test-time scaling) 核心思路:在模型推理阶段(而非仅训练阶段),通过强化学习激励模型主动生成高质量推理链,让模型从“被动响应CoT提示”变为“主动构建CoT”。
(2)技术本质:将推理链生成视为“强化学习的动作序列”,通过奖励函数引导模型学习“有效推理步骤”;
(3)创新点:无需大规模人工标注推理链(SFT数据),仅通过“问题+答案”的监督信号,让模型自主学习推理过程。
(1)推理链标注成本极高:
(2)避免限制模型的推理创造力:
(3)奖励信号必须自然可验证:
为了激励模型生成“有效推理链+正确答案”,设计双维度奖励函数(缺一不可),最终奖励为两者的加权和: Reward=w1⋅RCoT+w2⋅RAccuracy ( w1,w2 为权重,通常取0.3和0.7)。

图3 验证推理链存在的实例
(1)目标:激励模型生成完整的推理链,而非直接输出答案;
(2)验证逻辑:
(3)数学表示: RCoT=1 (满足所有校验)或 0 (不满足)。

图4 验证答案正确性的实例
(1)目标:激励模型生成正确的答案,推理链需服务于“正确答案”;
(2)验证逻辑:
(3)数学表示: RAccuracy=1 (正确)或 0 (错误)。
(1)动态预算(Dynamic budget):
(2)上下文感知(Context awareness):
(3)预算强制(Budget forcing):
max_reasoning_tokens,超出预算则截断推理链并输出答案;(4)连续思维(Continuous thoughts):
(1)核心目标:在“群体比较”中优化模型的推理策略,解决PPO在推理任务中“单样本更新导致的推理路径单一”问题,GRPO是专为推理模型设计的PPO改进算法。
(2)核心公式框架(与PPO一致,但变量定义不同):L(θ)=Maximize advantages+Don′t deviate too muchfrom old/base model
(3)关键创新:将“单样本优势值”改为“群体相对优势值”,适配推理任务“多推理路径并行优化”的需求。
GRPO与PPO的本质区别在于优势值的计算方式,这是其适配推理任务的核心
(1)定义: At=Q(St,at)−V(St) ,其中 Q(St,at) 是状态 St 下选择动作 at 的动作价值, V(St) 是状态 St 的价值函数;
(2)缺陷:仅考虑单个样本的“绝对优势”,容易导致模型过度聚焦于局部最优推理路径,缺乏全局探索。

图5 GRPO的Reward计算公式
(1)定义:对于包含G个样本的群体 o1,o2,...,oG (每个样本 oi 是一个完整的“问题→推理链→答案”序列),样本 oi 的优势值为:A^i,t=std({r1,r2,⋯,rG})ri−mean({r1,r2,⋯,rG})
变量定义:
- ri :样本 oi 的总奖励( ri=RCoT(oi)+RAccuracy(oi) );
- mean(r1,...,rG) :群体的平均奖励;
- std(r1,...,rG) :群体奖励的标准差。
(2)物理意义:优势值是样本奖励在群体中的“标准化Z分数”,反映样本的“相对优势”(比群体平均水平好多少);
(3)优势:减少个体奖励波动的影响,提升训练稳定性;鼓励模型探索“比群体平均更好的推理路径”,而非仅优化单个样本的绝对优势。

图6 GRPO与PPO详细对比图
[ \begin{aligned} \mathcal{J}{\text{GRPO}}(\theta) = \mathbb{E}{[q \sim P(Q), {o_i}{i=1}^G \sim \pi{\theta_{\text{old}}}(O|q)]} \Bigg[ & \frac{1}{G} \sum_{i=1}^G \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \Bigg{ \min \Bigg( \frac{\pi_\theta(o_{i,t}|q,o_{i,<t})}{\pi_{\theta_{\text{old}}}(o_{i,t}|q,o_{i,<t})} \hat{A}{i,t}, \quad \text{clip} \Bigg( \frac{\pi\theta(o_{i,t}|q,o_{i,<t})}{\pi_{\theta_{\text{old}}}(o_{i,t}|q,o_{i,<t})}, 1-\varepsilon, 1+\varepsilon \Bigg) \hat{A}{i,t} \Bigg) \Bigg} & - \beta , \mathbb{D}{\text{KL}}\big[ \pi_\theta | \pi_{\text{ref}} \big] \Bigg] \end{aligned} ]
参数解释:
- 期望项 E[q∼P(Q),oii=1G∼πθold(O∣q)] :对“问题分布 P(Q) ”和“旧策略生成的群体样本分布 πθold(O∣q) ”取期望,保证训练覆盖多样的问题和推理路径; > - ( q \sim P(Q) ):从问题分布中采样一个问题 (q)。 > - ( {o_i}{i=1}^G \sim \pi{\theta_{\text{old}}}(O|q) ):从旧策略 (\pi_{\theta_{\text{old}}}) 中采样 (G) 个回答(输出序列),针对同一个问题 (q)。
- 群体平均 G1∑i=1G :对群体中的G个样本取平均,利用群体相对优势值优化;
- 序列平均 ∣oi∣1∑t=1∣oi∣ :对每个样本的 ∣oi∣ 个token取平均,平衡不同长度推理链的贡献;
- 裁剪项 min[...,clip(...)] :与PPO一致,限制策略比的波动范围; > - (\pi_\theta):当前要优化的策略。 > - (\pi_{\theta_{\text{old}}}):旧策略,用于重要性采样。 > - (o_{i,t}):第 (i) 个回答的第 (t) 个 token。 > - (q, o_{i,<t}):问题 + 该回答的前 (t-1) 个 token 作为上下文。 > - (\hat{A}_{i,t}):优势函数估计,对于第 (i) 个回答的第 (t) 个 token。 > - (\varepsilon):PPO 的 clip 范围超参数。
- KL惩罚项 −βDKL[πθ∣∣πref] :新增项,通过KL散度限制新策略与参考模型的偏差,避免模型忘记基础推理能力。 > - (\beta):KL 惩罚系数。 > - (\pi_{\text{ref}}):参考策略(通常为预训练模型或SFT模型,不变)。 > - (\mathbb{D}{\text{KL}}):KL 散度,用于约束 (\pi\theta) 不要偏离 (\pi_{\text{ref}}) 太远。
JPPO(θ)=E[q∼P(Q),o∼πθold(O∣q)]∣o∣1∑t=1∣o∣min[πθold(ot∣q,o<t)πθ(ot∣q,o<t)At,clip(πθold(ot∣q,o<t)πθ(ot∣q,o<t),1−ϵ,1+ϵ)At]
与GRPO的相似之处:
与GRPO的核心差异:

图7 GRPO与PPO流程对比图
(1)GRPO 流程(上半部分)——GRPO 是专为推理任务设计的 PPO 改进算法,核心是群体化优化:
(2)PPO 流程(下半部分)——PPO 是传统的强化学习算法,核心是单样本迭代优化:
(3)核心差异总结
| 维度 | GRPO | PPO |
|---|---|---|
| 采样方式 | 群体采样((G) 条输出) | 单次采样(1 条输出) |
| 优势值计算 | 群体相对优势值(Z-score,群体内对比) | 单样本绝对优势值(GAE,自身对比) |
| 模型依赖 | 仅需策略模型、奖励模型、参考模型 | 需策略模型、奖励模型、参考模型、价值模型 |
| 核心优势 | 适配推理任务“多路径求解”的特性,训练更稳定,鼓励探索更优路径 | 算法成熟,实现简单,适用于广泛的强化学习场景 |
| 训练复杂度 | 较高,需处理群体数据 | 较低,单样本迭代 |

图8 训练问题现象图
随GRPO训练步数增加,模型的平均输出token数(推理链+答案) 持续上升(如DeepSeek R1-Zero从0增至12000+ tokens),但推理准确率(Pass@1)提升趋于平缓——模型生成大量冗余推理步骤(如重复计算、无关推导),导致推理效率低下。
GRPO损失函数中的 ∣oi∣1 序列平均项是核心原因:
核心思路:移除 ∣oi∣1 的序列平均项,让每个token的贡献相等,避免长度依赖的奖励偏差:
(1)DAPO(Distributed Advantage Policy Optimization):
(2)Dr.GRPO(Doctor GRPO):
通过DeepSeek R1-Zero的训练曲线验证两种方案的有效性:
(1)难度偏置调整:
(2)鼓励推理多样性:

图9 DeepSeek基础模型与推理模型

图10 DeepSeek V3-Base底座模型细节图
(1)架构类型:混合专家模型(Mixture of Experts, MoE);
(2)参数量:总参671B,激活参37B(仅部分专家参与每次推理,平衡性能与效率);
(3)核心组件:
核心目标:验证“仅通过GRPO强化学习,无需有监督微调(SFT),即可让基础模型具备推理能力”,训练流程仅2步
(1)步骤1:预训练基础模型V3-Base
(2)步骤2:GRPO强化学习训练(推理数据)

图11 训练数据模版
训练数据:推理任务数据集(数学题、代码题),仅包含“问题+答案+测试用例”,无人工标注的推理链;
奖励函数: Reward=0.3⋅RCoT+0.7⋅RAccuracy ;
GRPO参数:群体大小 G=32,裁剪系数 ε=0.2 ,KL惩罚系数 β=0.1 ;
具体实现:
群体采样:对每个问题 q ,旧策略 πθold 生成 G=32 条不同的推理链-答案序列 o1,o2,...,o32 ,形成一个优化群体。
奖励计算:
RAccuracy :通过单元测试(代码)或符号计算(数学)自动验证答案正确性,正确为1,错误为0。
RCoT :通过规则校验推理链的完整性(如长度>50 tokens,包含逻辑连接词),完整为1,否则为0。
优势值归一化:在群体内计算Z-score,得到相对优势值 A^i,t 。
梯度更新:使用GRPO损失函数计算梯度,更新模型参数 θ ,并固定参考模型 πref 为初始的V3-Base。
(3)R1-Zero 实验结果与分析:仅用GRPO可以“从无到有”地赋予模型推理能力(无需SFT模型),但生成的推理链缺乏人类可读性,且存在严重的效率问题。
为了解决R1-Zero的缺陷,DeepSeek团队设计多阶段混合训练流程,核心思想是用SFT学习“怎么说(格式)”,用GRPO学习“怎么想(正确性)”。
(1)步骤1:预训练底座
(2)步骤2:小规模有监督微调(SFT-1)
(3)步骤3:第一阶段GRPO训练(GRPO-1)
新增 RFluency (流畅度Language Consistency):通过一个小型评估模型打分,确保推理链语言自然。
(4)步骤4:大规模有监督微调(SFT-2)
(5)步骤5:第二阶段GRPO训练(GRPO-2)

图12 DeepSeek R1与其他模型的对比图
核心结论:通过 SFT规范格式 + GRPO优化正确性 + 多阶段融合,R1在专业推理任务上超越了传统大模型,证明了该训练范式的优越性。

图13 蒸馏模型的变革
| 蒸馏类型 | 传统LLM蒸馏 | 推理模型蒸馏 (Reasoning Distillation) |
|---|---|---|
| 教师模型 | 大模型 | 推理大模型(如DeepSeek R1) |
| 学习目标 | 匹配教书的 下一个Token概率分布 | 匹配教师的 推理链 (Reasoning Chain) + 答案 |
| 核心思想 | “抄答案” | “抄解题过程” |
(1)数据生成(Teacher Side):使用 DeepSeek R1 对大规模推理数据集进行推理,生成包含完整详细推理链的高质量样本。
(2)学生训练(Student Side):
(3)输出:R1-Distill-Qwen-32B 等轻量级推理模型。
性能保留:R1-Distill-Qwen-32B 在 AIME 上的 Pass@1 达到 72.6%,远超同规模的原生模型,甚至超过了 GPT-4o(9.3%)。
成本降低:推理速度比671B MoE 快几倍;部署成本低,可在单张消费级GPU(如RTX 4090)上运行,而R1需要多卡集群。
工程启示:推理链蒸馏是平衡性能与成本的最佳实践,是推理模型从实验室走向工业界的关键一步。
核心结论
- 思维链(CoT) 作为推理模型的核心表达范式,通过显式的步骤化推导弥补了这一缺陷;而强化学习则是推动模型从“被动响应CoT提示”向“主动生成高质量CoT”转变的关键手段,为推理能力的自主习得提供了技术框架。
- GRPO算法作为PPO在推理任务中的针对性改进,核心创新在于采用群体相对优势值替代传统的单样本绝对优势值。这一设计完美适配了推理任务“多路径求解”的特性,通过群体内的横向对比优化策略,既提升了训练稳定性,又有效鼓励了模型对更优推理路径的探索,成为推理模型训练的核心RL算法。
- GRPO训练中出现的输出长度膨胀问题,其数学根源是序列长度归一化项带来的不良激励。通过均衡token级贡献的改进方案(DAPO/Dr. GRPO),移除或重构长度相关的归一化逻辑,可在不损失推理准确率的前提下,实现推理链长度的有效控制。
- DeepSeek R1的工业化训练流程,验证了GRPO+多阶段SFT混合范式的有效性。其中,SFT负责规范推理链的格式与可读性,解决R1-Zero的逻辑混乱问题;多阶段GRPO则聚焦准确率与场景适配性的精准优化。二者协同,让模型同时具备推理链规范性与任务高准确率,成为推理模型从技术验证走向商用落地的标杆路径。
- 推理链蒸馏突破了传统“结果模仿”的局限,通过让小模型学习大模型的完整推理过程,实现了“轻量化”与“高性能”的平衡。
按顺序完成这组文章,循序渐进地掌握主题
发现错误、内容过时或有改进想法?欢迎告诉我
根据本文分类与标签,为你推荐可能感兴趣的内容

系统梳理大语言模型偏好调优(Preference Tuning)的核心技术与方法,涵盖偏好数据的三大类型(点态/成对/列表型)与获取流程、RLHF两阶段架构(奖励建模+PPO强化学习)、BoN替代方案,以及DPO的数学原理与优势,最后对比RLHF与DPO的实现难度与性能差异。
阅读文章
系统梳理DAPO解耦裁剪与动态采样策略优化的核心技术原理,解析Clip-Higher、Dynamic Sampling、Token-Level Loss与Overlong Reward Shaping四项创新如何解决GRPO在长CoT场景下的熵崩塌与训练不稳定问题,将GRPO从实验室算法打磨为工业级系统。
阅读文章
系统梳理GRPO群体相对策略优化的核心原理、组内相对优势估计机制与训练流程,解析其如何通过移除价值网络实现显存占用降低40%以上,并对比GRPO与PPO、DPO的差异及各自适用场景。
阅读文章请使用微信扫描二维码分享
当前文章会保持在原页面