
Lecture 2:Transformer-based models & tricks
系统梳理Transformer进阶核心模块,涵盖缩放点积与多头注意力回顾、位置编码从绝对到相对(RoPE)的演进、层归一化(Pre-Norm/RMSNorm)优化、注意力近似方法(稀疏注意力/MQA/GQA)、三大衍生架构对比,以及BERT的预训练(MLM/NSP)、微调流程与经典变体(DistilBERT/RoBERTa)。
阅读文章ZHY's Blog
A UNIVERSE OF IDEAS · BY ZHANG HAOYI
让好奇心 点亮知识宇宙
在代码、模型与思想之间自由漫游。这里持续记录人工智能、机器学习、软件工程与成长实践,让每次阅读都成为一次新的发现。
ARTICLE NOTE
课程涉及大量专业缩写,按模型/策略/数据集/架构技术/任务/指标六大类划分,无额外记忆负担,核心缩写如下:
分词(Tokenization)→词表示(Word representation)→RNNs→自注意力机制(Self-attention)→Transformer架构→端到端案例(End-to-end example)。
NLP任务分为分类、多分类、生成三类,覆盖文本处理主流场景,各任务均有专属数据集和评估指标,具体如下:
(1)分类任务
(2)多分类任务
(3)生成任务
(1)情感提取(Sentiment Extraction)
(2)命名实体识别(NER)
(3)机器翻译(MT)
NLP技术发展围绕解决序列数据处理痛点展开,核心节点与背景如下:
(1)定义:将完整文本拆分为模型可处理的最小单位(token),是NLP的第一步预处理,直接影响模型输入质量。
(2)三种核心分词方法(附示例/优劣)
以句子「A cute teddy bear is reading.」为例,各方法拆分效果、优点、缺点如下表:
| 分词方法 | 拆分示例 | 优点 | 缺点 |
|---|---|---|---|
| 词级别(Word-level) | A / cute / teddy / bear / is / reading | 逻辑简单、结果易解释 | 易出现未登录词(OOV);无法利用词根/词缀知识 |
| 子词级别(Subword-level,如WordPiece、BPE) | A / cute / ted / ##dy / bear / is / read / ##ing | 利用常见词缀/前缀;从数据中学习拆分规则;OOV概率远低于词级别 | 仍存在少量OOV可能 |
| 字符级别(Character-level) | A / c / u / t / e / t / e / d / d / y / … | 几乎无OOV;对大小写、拼写错误鲁棒性强 | 计算速度慢;词嵌入结果无解释性 |
(1)核心动机:原始独热编码(One-hot) 无法表示词汇的语义关联(如「teddy bear」和「soft」的独热编码内积为0,模型无法识别二者语义相关),因此需要学习型词嵌入,将词汇映射为低维稠密向量。
(2)两种表示方法对比
| 表示方法 | 形式特点 | 核心问题 |
|---|---|---|
| 独热编码—Naive(one-hot) encoding | 向量中仅一个位置为1,其余为0,高维稀疏 | 无语义信息;存在维度灾难;无法衡量词汇相似度 |
| 学习型嵌入—Learned Embedding | 低维稠密向量(如「soft」→[0.95, 0.32, 0.01]) | 可通过向量内积衡量语义相似度,内积越接近1,语义越相似 |
(3)经典模型:Word2vec
核心原理:基于数十亿文本训练的简单神经网络,通过代理任务学习一个嵌入层,实现词汇的语义表示;
两种代理任务:
模型架构:输入层(词汇表大小V)→隐藏层(嵌入维度d)→输出层(词汇表大小V);
核心缺点:不考虑词序、嵌入结果无上下文感知(同一个词在不同语境下嵌入向量完全相同)。
(1)循环神经网络(RNNs,1980s)
核心突破:首个能捕捉词序的神经网络,连接形成时间序列,按文本顺序逐个输入token,隐藏状态随时间更新,保留前文信息;
核心问题:梯度消失问题(无法有效捕捉长距离依赖)、顺序计算导致速度慢;
适用场景:短序列文本的序列建模。

图1 不同场景下的RNN结构原理
(2)长短期记忆网络(LSTM,1997)
核心改进:对RNN的隐藏状态做结构化设计,通过门控机制(输入门、遗忘门、输出门)控制信息的保留与丢弃,缓解梯度消失问题,增强长距离依赖捕捉能力;
核心局限:仍是序列计算,未解决计算速度慢的问题;
地位:成为RNN的主流改进版本,长期为NLP序列建模的SOTA方法。

图2 LSTM结构原理
(3) Word2vec与RNN/LSTM对比
| 方法 | 核心优点 | 核心缺点 |
|---|---|---|
| Word2vec(CBOW/Skip-gram) | 模型简单、计算快;嵌入结果直观,易理解 | 不考虑词序;无上下文感知;无法处理序列依赖 |
| RNN/LSTM | 捕捉词序和序列依赖;长期为NLP SOTA方法 | 梯度消失(LSTM缓解但未解决);顺序计算,速度慢;难以处理超长序列 |
(1)诞生背景:机器翻译任务中,传统Seq2seq(RNN+编码器-解码器)无法有效捕捉长距离依赖,例如翻译长句时,模型容易忘记前文的核心词汇,导致翻译错误。
(2)核心思想:让模型在生成输出文本时,主动关注输入文本的相关部分(如翻译法语时,模型关注英文原句的「teddy bear」),从根本上解决长距离依赖问题。
(3)核心突破:论文《Attention is All You Need》首次提出纯注意力机制的Transformer,抛弃序列计算,实现并行处理,解决了RNN/LSTM的效率问题,在机器翻译任务上达到SOTA,成为NLP领域的里程碑,也是LLMs的核心基础。
(4)核心特点:基于自注意力机制(Self-attention);并行计算大幅提升训练/推理效率;支持捕捉超长序列的长距离依赖。
(5)自注意力机制(Self-attention)
核心概念:Query(Q,查询)、Key(K,键)、Value(V,值)——将文本中的每个token通过线性变换,分别映射为Q、K、V三个向量,通过Q与K的相似度,为每个V分配权重,实现token间的关联建模。如下图所示例子:

图3 Q、K、V矩阵的含义与计算
核心计算:缩放点积注意力——公式: softmax(dkQKT)V
核心步骤:Q与K的转置做矩阵乘法 → 除以 dk (K的维度,缩放避免内积值过大导致softmax梯度消失) → 做softmax得到权重 → 与V做矩阵乘法得到最终注意力输出;
核心意义:通过权重分配,让每个token“关注”文本中其他相关的token。
(6)多头注意力(Multi-Head Attention)
核心思想:并行运行多个自注意力层,每个层学习不同的Q/K/V映射,捕捉不同维度的注意力特征;
计算步骤:将Q/K/V拆分为h个头部 → 各自计算缩放点积注意力 → 将h个头部的结果拼接→线性变换得到最终输出;
类比:类似计算机视觉中的多卷积核,从不同角度提取特征,提升模型表达能力。

图4 多头注意力机制
Transformer由编码器(Encoder)和解码器(Decoder)两部分组成,均为堆叠N层的结构,核心模块包括:注意力层、前馈神经网络(FFNN)、残差连接+层归一化(Add&Norm)、位置编码(PE),整体为端到端的序列建模架构。

图5 Transformer整体架构
(1)通用输入处理:所有输入需经过三步处理,即分词生成token序列 → 词嵌入(Learned Embedding) → 位置编码(Positional Encoding),最终得到位置感知的嵌入向量。
(2)编码器(Encoder)
核心作用:对输入文本进行编码,生成上下文感知的编码嵌入向量,包含输入文本的全部语义信息;
输入:位置感知的嵌入向量(源语言文本);
每层结构(堆叠N层):自注意力层(Encoder-Encoder Self-attention,全局关注) → Add&Norm(残差连接+层归一化) → 前馈神经网络(FFNN,全连接) → Add&Norm;
核心参数:N(堆叠层数)、h(注意力头数)、d_model(嵌入维度)、d_FF/ d_key/ d_value(子层维度)、V(词汇表大小)。
(3)解码器(Decoder)
核心作用:基于编码器的输出,生成目标文本,是自回归的生成过程;
输入:位置感知的嵌入向量(目标语言文本,右移一位,以[BOS]开始);
每层结构(堆叠N层):掩码自注意力层(Masked Decoder-Decoder Self-attention,防止看到未来token) → Add&Norm → 编码器-解码器注意力层(关注编码器的输出) → Add&Norm → 前馈神经网络(FFNN,全连接) → Add&Norm;
掩码(Mask):为未生成的token分配无穷小的权重,确保模型生成时只能看到前文,无法看到后文;
最终输出:经线性层+softmax后,得到目标语言token的概率分布,选择概率最大的token作为生成结果。
(4)关键模块:位置编码(Positional Encoding,PE)
核心动机:Transformer是并行计算,无序列信息,无法识别token的位置,因此需要为token添加位置信息;
实现方式:可学习型(由模型训练得到)或硬编码(按固定公式生成),将位置信息与词嵌入向量相加,不改变嵌入维度;
核心目标:通过位置编码的向量内积,让模型识别token的相对/绝对位置关系。
(5)核心辅助模块:Add&Norm
组成:残差连接(将层输入与层输出相加)+层归一化(对向量做归一化处理);
核心作用:解决深度网络的梯度消失问题,提升模型训练的稳定性和收敛速度。
(6)Transformer的核心计算技巧
多头注意力:并行捕捉多维度注意力特征,提升模型对文本的理解能力;
标签平滑(Label Smoothing):
并行计算:抛弃RNN的序列计算,所有token同时处理,大幅提升训练/推理效率;
共享嵌入层:编码器和解码器的词嵌入层、最终输出的线性层共享参数,减少模型参数量。

图6 Transformer案例流程
以英文「A cute teddy bear is reading.」→法语「Un ours en peluche mignon lit.」为例,完整梳理Transformer的工作流程,核心为编码器编码+解码器自回归生成:
英文输入处理:添加[BOS](句首)/[EOS](句尾) → 分词 → 词嵌入(embedding) → 位置编码(PE) → 得到位置感知的嵌入矩阵(position-aware embeddings matrix);
编码器编码:嵌入矩阵输入编码器,经N层自注意力 + FFNN + Add&Norm,生成上下文感知的编码嵌入向量(context-aware encoded embeddings);
解码器初始化:法语输入以[BOS]为起始(右移一位),经词嵌入+位置编码得到初始向量;
解码器第一次生成:
解码器循环生成:将「Un」作为下一个输入,重复步骤4,依次生成「ours」「en」「peluche」「mignon」「lit」;
终止条件:当模型生成[EOS]时,停止生成,拼接所有token得到完整法语文本「Un ours en peluche mignon lit.」。
Note总结
- NLP技术的发展核心是解决序列数据处理的痛点:从无词序(Word2vec) → 有词序但效率低(RNN/LSTM) → 并行计算 + 长距离依赖(Transformer);
- Transformer的核心创新是纯自注意力机制+并行计算,抛弃了传统的序列计算,成为大语言模型的技术基础;
- Transformer的核心架构是编码器-解码器,通过QKV自注意力实现token间的关联建模,位置编码弥补并行计算的词序缺失;
- NLP的通用流程为:分词→词表示→模型处理→生成/预测→指标评估,每个环节均有经典方法和专属工具;
- 自注意力机制是Transformer的核心,缩放点积注意力公式和多头注意力是理解后续LLMs的关键基础。
按顺序完成这组文章,循序渐进地掌握主题
发现错误、内容过时或有改进想法?欢迎告诉我
根据本文分类与标签,为你推荐可能感兴趣的内容

系统梳理Transformer进阶核心模块,涵盖缩放点积与多头注意力回顾、位置编码从绝对到相对(RoPE)的演进、层归一化(Pre-Norm/RMSNorm)优化、注意力近似方法(稀疏注意力/MQA/GQA)、三大衍生架构对比,以及BERT的预训练(MLM/NSP)、微调流程与经典变体(DistilBERT/RoBERTa)。
阅读文章
系统梳理大语言模型在跨模态与前沿技术方向的核心进展,涵盖Transformer多模态泛化本质、ViT与VLM的视觉适配方案、扩散LLMs(MDM)的并行生成突破、跨模态技术交叉融合(扩散架构/Transformer/MSRoPE/DeepSeek-OCR)、LLM基础研究趋势(帕累托优化/类存内计算)及应用场景与未来展望,最后提供学术与工程跟进渠道。
阅读文章
系统梳理大语言模型(LLM)训练的全生命周期,涵盖训练范式演变(传统→迁移→预训练+微调)、预训练目标与缩放规律(含Chinchilla定律)、训练四阶段流程(初始化→前向→反向→Adam更新)、核心内存优化(ZeRO并行/Flash Attention/混合精度)、有监督微调(SFT/指令调优),以及参数高效微调(LoRA/QLoRA)原理与模型对齐目标。
阅读文章请使用微信扫描二维码分享
当前文章会保持在原页面