跳到主要内容
KNOWLEDGE TOPIC

AI_Alignment

11 篇文章 · 分类

AI_Alignment

SFT (Supervised Fine-Tuning)—— 监督微调

深入剖析监督微调(SFT)的核心原理,涵盖最大似然估计与交叉熵损失的数学推导、Loss Masking 代码实现、灾难性遗忘与不完全学习现象(ILP)等系统挑战,以及数据质量、分层学习率等最佳实践。全面理解 SFT 作为 LLM 后训练基石的定位、优势与演进方向。

阅读文章