跳到主要内容
Contrastive Language-Image Pre-training —— CLIP对比学习
系统讲解CLIP的核心原理与技术演进:从双塔架构出发,推导InfoNCE损失函数的数学本质及其与交叉熵的等价性;剖析WIT-400M大规模图文对预训练的工程挑战;深入解读零样本分类的工作原理;并介绍SigLIP如何通过Sigmoid损失替代Softmax归一化,实现更优的小批次训练效率与灵活性。
3505 字
|
18 分钟
Cover Image of the Post
RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习
系统梳理RLVR(Reinforcement Learning with Verifiable Rewards)的核心思想、数学形式化、主流算法(PPO、GRPO、PACS、ROVER)及训练流程,对比RLHF与RLVR的本质差异,并探讨验证器可靠性、奖励稀疏等核心挑战与前沿解决方案。
4514 字
|
23 分钟
Cover Image of the Post
Comparison of RL Algorithm —— PPO、GRPO、DPO、DAPO、GSPO技术详解与对比
从12个核心维度系统对比PPO、GRPO、DPO、DAPO与GSPO五种大模型强化学习对齐算法,剖析其技术演进脉络、核心机制与适用场景,揭示从"通用重器"到"专属利刃"的进化逻辑。
4076 字
|
20 分钟
Cover Image of the Post
GSPO (Group Sequence Policy Optimization) -- 群组序列策略优化
系统梳理GSPO群组序列策略优化的核心原理,解析其如何通过序列级重要性比率与长度归一化从根本上修复GRPO的token级采样缺陷,解决MoE专家震荡与长序列方差累积问题,并探讨GSPO的局限与后续演进。
5795 字
|
29 分钟
Cover Image of the Post
DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization) -- 解耦裁剪与动态采样策略优化
系统梳理DAPO解耦裁剪与动态采样策略优化的核心技术原理,解析Clip-Higher、Dynamic Sampling、Token-Level Loss与Overlong Reward Shaping四项创新如何解决GRPO在长CoT场景下的熵崩塌与训练不稳定问题,将GRPO从实验室算法打磨为工业级系统。
6644 字
|
33 分钟
Cover Image of the Post
GRPO (Group Relative Policy Optimization) -- 群体相对策略优化
系统梳理GRPO群体相对策略优化的核心原理、组内相对优势估计机制与训练流程,解析其如何通过移除价值网络实现显存占用降低40%以上,并对比GRPO与PPO、DPO的差异及各自适用场景。
7183 字
|
36 分钟
Cover Image of the Post
DPO (Direct Preference Optimization) -- 直接偏好优化
系统梳理DPO直接偏好优化的核心原理、数学推导与实现机制,解析其如何将RLHF的多阶段流程简化为单阶段监督学习,并对比DPO与PPO的差异及各自适用场景。
5899 字
|
29 分钟
Cover Image of the Post
PPO(Proximal Policy Optimization) -- 近端策略优化
系统梳理PPO近端策略优化的核心思想、目标函数、训练流程与优缺点,解析其在LLM强化学习对齐中的应用,并探讨PPO的局限与后续演进方向。
5602 字
|
28 分钟
Cover Image of the Post
Reinforcement Learning -- 策略梯度、优势函数、重要性采样与KL散度惩罚
系统梳理策略梯度、优势函数、重要性采样与KL散度惩罚的核心概念,串联从VPG到PPO的技术演进逻辑,并探讨On-Policy与Off-Policy的权衡及数据漂移问题。
6255 字
|
31 分钟
Cover Image of the Post
RLHF (Reinforcement Learning from Human Feedback) —— 基于人类反馈的强化学习
系统拆解RLHF的三步流程、核心算法原理、代码实现细节以及面临的挑战,涵盖SFT、奖励模型训练、PPO优化、奖励黑客等核心议题,并探讨DPO、RLAIF等演进方向。
3301 字
|
17 分钟
Cover Image of the Post