2026年7月文章 8 篇
RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习
系统梳理RLVR(Reinforcement Learning with Verifiable Rewards)的核心思想、数学形式化、主流算法(PPO、GRPO、PACS、ROVER)及训练流程,对比RLHF与RLVR的本质差异,并探讨验证器可靠性、奖励稀疏等核心挑战与前沿解决方案。
大模型强化学习对齐方案:PPO、GRPO、DPO、DAPO与GSPO技术详解与对比
从12个核心维度系统对比PPO、GRPO、DPO、DAPO与GSPO五种大模型强化学习对齐算法,剖析其技术演进脉络、核心机制与适用场景,揭示从"通用重器"到"专属利刃"的进化逻辑。
GSPO (Group Sequence Policy Optimization) -- 群组序列策略优化
系统梳理GSPO群组序列策略优化的核心原理,解析其如何通过序列级重要性比率与长度归一化从根本上修复GRPO的token级采样缺陷,解决MoE专家震荡与长序列方差累积问题,并探讨GSPO的局限与后续演进。
DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization) -- 解耦裁剪与动态采样策略优化
系统梳理DAPO解耦裁剪与动态采样策略优化的核心技术原理,解析Clip-Higher、Dynamic Sampling、Token-Level Loss与Overlong Reward Shaping四项创新如何解决GRPO在长CoT场景下的熵崩塌与训练不稳定问题,将GRPO从实验室算法打磨为工业级系统。
GRPO (Group Relative Policy Optimization) -- 群体相对策略优化
系统梳理GRPO群体相对策略优化的核心原理、组内相对优势估计机制与训练流程,解析其如何通过移除价值网络实现显存占用降低40%以上,并对比GRPO与PPO、DPO的差异及各自适用场景。
DPO (Direct Preference Optimization) -- 直接偏好优化
系统梳理DPO直接偏好优化的核心原理、数学推导与实现机制,解析其如何将RLHF的多阶段流程简化为单阶段监督学习,并对比DPO与PPO的差异及各自适用场景。
PPO(Proximal Policy Optimization) -- 近端策略优化
系统梳理PPO近端策略优化的核心思想、目标函数、训练流程与优缺点,解析其在LLM强化学习对齐中的应用,并探讨PPO的局限与后续演进方向。
强化学习基础 -- 策略梯度、优势函数、重要性采样与KL散度惩罚
系统梳理策略梯度、优势函数、重要性采样与KL散度惩罚的核心概念,串联从VPG到PPO的技术演进逻辑,并探讨On-Policy与Off-Policy的权衡及数据漂移问题。