2025年8月文章 11 篇
加密文档测试
加密文档测试
LSTM & GRU —— 门控循环神经网络
系统讲解LSTM与GRU的门控机制设计哲学与数学原理。从LSTM的“双轨”架构(细胞状态+隐藏状态)与三门结构(遗忘门、输入门、输出门)出发,推导细胞状态更新公式如何通过按元素加法路径缓解梯度消失,并深入剖析GRU的两大简化及其参数量优势。附带讨论双向LSTM与深层堆叠LSTM的应用场景。
RNN & BPTT —— 循环神经网络与随时间反向传播
系统讲解循环神经网络(RNN)的数学原理与随时间反向传播(BPTT)算法。从RNN的循环结构与共享参数出发,推导BPTT的梯度表达式,揭示梯度消失与梯度爆炸的数学根源,并介绍梯度裁剪作为应对梯度爆炸的工程解法。附带讨论LSTM如何通过门控机制缓解梯度消失。
Residual Network —— ResNet残差网络
系统讲解ResNet残差网络的设计哲学与数学原理:从退化问题的本质出发,推导残差块F(x)+x如何通过恒等映射直通路径缓解梯度消失,详解Bottleneck块如何将参数量减少约94%,并对比ResNet(加法融合)与DenseNet(拼接融合)的梯度流动差异。
CNN —— 卷积神经网络
系统讲解卷积神经网络(CNN)的四大核心操作:从严格卷积与互相关的数学区别出发,推导感受野的递推计算公式,剖析空洞卷积如何在不增加参数的前提下扩大感受野,详解Max Pooling与Average Pooling的反向传播机制,以及1×1卷积的跨通道信息整合、降维/升维与增加非线性的三大作用。
Activation & Initialization —— 激活函数与权重初始化
系统讲解激活函数与权重初始化的协同演进关系。从Sigmoid/Tanh的梯度饱和问题出发,推导ReLU及其变体(LeakyReLU、PReLU、ELU、GELU、Swish)如何解决梯度消失,并深入推导Xavier初始化(适用于Sigmoid/Tanh)和Kaiming初始化(适用于ReLU)的方差守恒数学原理。
MLP & Back Propagation —— 多层感知机与反向传播
系统讲解多层感知机(MLP)的前向传播矩阵运算与反向传播链式法则,以计算图为工具手动推导3层MLP的误差回传与参数梯度公式,提炼出误差回传、权重梯度、偏置梯度的核心公式。同时讨论通用近似定理(UAT)的砖块构造直觉,以及Batch Normalization训练时mini-batch统计与推理时滑动平均(EMA)机制。
Autograd & Computational Graph —— 自动微分与计算图
系统讲解自动微分与计算图的底层原理:从计算图的有向无环图(DAG)结构出发,剖析链式法则是反向传播的“数学引擎”,阐明雅可比矩阵与海森矩阵的几何意义与计算方式,深入解析PyTorch中retain_graph与create_graph的区别与应用场景,对比静态图与动态图的底层哲学差异,并通过手写微型自动微分框架揭示Autograd的本质实现。
Gradient Descent Optimizer —— 梯度下降优化器
系统梳理梯度下降优化器的完整进化路径:从BGD、SGD到MBGD的效率与稳定性权衡,从动量法与NAG解决峡谷地形震荡,到AdaGrad实现参数级学习率、RMSProp引入指数加权平均解决学习率消亡,最终融合为集大成者Adam,并深入剖析AdamW如何通过解耦权重衰减修复Adam的正则化失效问题。
Probability & Information —— 概率论与信息论基础
系统讲解深度学习中的概率论与信息论基础:从联合分布、边缘化与贝叶斯定理出发,推导最大似然估计(MLE)的完整四步流程并揭示其与MSE/交叉熵损失的联系,引入最大后验(MAP)估计并阐明L2/L1正则化与高斯/拉普拉斯先验的对应关系,深入剖析KL散度的非对称性及其方向含义,最后证明KL散度、交叉熵与MLE三者的数学等价性。
Tensor Operations —— 向量、矩阵与张量运算
系统讲解深度学习中的线性代数基础:从张量的维度与Shape变换出发,深入区分Hadamard积(*)与矩阵乘法(@)的本质差异,解析L1/L2/Frobenius范数的几何意义与机器学习用途,并直观理解特征分解的“换基→缩放→换回”几何解释,以及SVD在降维与数据压缩中的核心价值。