Table of Contents
Statistics
Archive
A chronological list of all published posts.
2026
48 posts
08-16
Video Audio Multimodal —— 视频理解 & 视频生成 & 音频处理
#视频理解 #视频生成 #音频处理 #3D卷积 #多模态 #VideoMAE #Sora #Whisper #VALL-E
08-14
Vision-Language-Action —— VLA具身智能
#具身智能 #VLA #Diffusion #多模态 #RT-2 #Action Chunking
08-12
Multimodal RAG —— 多模态RAG
#RAG #ColPali #延迟交互 #多模态
08-10
Denoising Diffusion Probabilistic Models —— DDPM扩散模型
#扩散模型 #DDPM #Diffusion #多模态 #潜空间扩散 #DiT
08-08
Multimodal Large Language Model —— MLLM多模态大语言模型
#MLLM #多模态 #模态连接器 #LLaVA #Q-Former #DPO
08-06
Vision-Language Model —— VLM视觉语言模型
#VLM #视觉语言模型 #CLIP #Qwen3-VL #多模态
08-04
Vision Transformer —— ViT视觉Transformer
#Transformer #ViT #多模态 #归纳偏置 #Swin Transformer #位置编码外推
08-02
Contrastive Language-Image Pre-training —— CLIP对比学习
#CLIP #对比学习 #多模态 #InfoNCE #SigLIP
07-16
RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习
#RLVR #强化学习 #后训练 #GRPO
07-14
大模型强化学习对齐方案:PPO、GRPO、DPO、DAPO与GSPO技术详解与对比
#PPO #GRPO #DPO #DAPO #GSPO #RLHF #强化学习 #对比学习
07-12
GSPO (Group Sequence Policy Optimization) -- 群组序列策略优化
#GSPO #GRPO #RLHF #强化学习 #推理增强 #Qwen
07-10
DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization) -- 解耦裁剪与动态采样策略优化
#DAPO #GRPO #RLHF #强化学习 #推理增强
07-08
GRPO (Group Relative Policy Optimization) -- 群体相对策略优化
#GRPO #RLHF #强化学习 #推理增强 #DeepSeek
07-06
DPO (Direct Preference Optimization) -- 直接偏好优化
#DPO #RLHF #监督学习
07-04
PPO(Proximal Policy Optimization) -- 近端策略优化
#PPO #RLHF #强化学习
07-02
强化学习基础 -- 策略梯度、优势函数、重要性采样与KL散度惩罚
#强化学习 #基础知识
06-30
RLHF (Reinforcement Learning from Human Feedback) —— 基于人类反馈的强化学习
#RLHF #强化学习 #后训练 #奖励模型
06-28
SFT (Supervised Fine-Tuning)—— 监督微调
#SFT #微调 #后训练
06-26
PEFT (Parameter-Efficient Fine-Tuning) —— 参数高效微调
#PEFT #LoRA #参数高效微调 #后训练
04-18
MLOps & Observability
#MLOps #Kubernetes #GPU调度 #可观测性
04-16
TTFT & TPOT & Throughput —— LLM推理性能指标
#TTFT #TPOT #吞吐量 #尾延迟 #推理性能
04-14
Quantization & Flash Attention —— LLM推理优化技术(二)
#量化 #AWQ #GPTQ #FlashAttention #KV Cache #推理优化
04-12
Speculative Decoding —— LLM推理优化技术(一)
#推测解码 #拒绝采样 #推理优化
04-10
Continuous Batching & Chunked Prefill —— LLM推理引擎调度
#推理引擎调度 #连续批处理 #Chunked Prefill #vLLM #SGLang
04-08
PagedAttention & RadixAttention —— LLM推理引擎架构
#推理引擎 #vLLM #PagedAttention #SGLang #RadixAttention #KV Cache #前缀缓存
04-06
NCCL & DP/MP/PP/FSDP/ZeRO —— 分布式训练
#分布式训练 #NCCL #数据并行 #张量并行 #流水线并行 #ZeRO
04-04
Shared Memory & Coalesced Access —— CUDA性能优化技术
#CUDA #共享内存 #合并访存 #矩阵乘法Tiling #性能优化
04-02
GPU & Grid-Block-Thread —— CUDA编程心智模型
#CUDA #GPU架构 #SIMT #Warp #共享内存
04-01
vLLM与SGLang:大模型推理框架的全面对比
#vLLM #SGLang #Infra #推理增强 #对比学习
04-01
SGLang:大模型推理的"结构化程序"革命
#SGLang #Infra #推理增强 #RadixAttention #KV Cache
04-01
vLLM:大模型推理系统的分页内存革命
#vLLM #Infra #推理增强 #PagedAttention #KV Cache
03-16
Multi-Agent System—— 多智能体系统
#AI Agent #多智能体系统 #协作模式
03-14
Agent Communication Protocols —— MCP & A2A
#AI Agent #MCP #A2A #通信协议 #多智能体协作
03-12
Agent Engineering —— Prompt & Context & Harness & Loop
#Prompt Engineering #Context Engineering #Harness Engineering #Loop Engineering #AI Agent #沙箱 #可观测性
03-10
Memory System —— Agent记忆系统
#AI Agent #向量数据库 #MemGPT #分层缓存 #记忆压缩
03-08
Retrieval-Augmented Generation —— 检索增强生成
#AI Agent #RAG #检索增强生成 #分块策略 #重排序
03-06
Function Calling —— 工具调用
#AI Agent #工具调用 #Function Calling #并行调用 #MCP
03-04
Agent Paradigms —— ReAct & Plan-and-Solve & Reflection
#AI Agent #ReAct #Plan-and-Solve #Reflection #CoT
03-02
Agent Architecture —— LLM & Planning & Tool & Memory
#AI Agent #LLM #规划 #工具调用 #Function Calling #MCP #记忆 #RAG
02-18
Lecture 9 —— LLM多模态泛化与前沿探索:从ViT/VLM跨模态适配到扩散LLMs与未来发展趋势
#Transformer #VLM #ViT #Diffusion #多模态
02-16
Lecture 8 —— LLM评估全解:从人工评分、LLM-as-a-Judge到基准测试与工具调用故障排查
#LLM-as-a-Judge #benchmark
02-14
Lecture 7 —— Agentic LLMs全解析:从RAG检索增强、工具调用(Tool Calling)到多智能体(Agent)协作
#智能体 #Agent #RAG #Tool Calling #MCP #ReAct
02-12
Lecture 6 —— LLM推理能力深度解析:从思维链(CoT)到GRPO强化学习与DeepSeek R1训练范式
#LLM #CoT #RLHF #GRPO #DAPO #DeepSeek #模型对齐 #推理增强
02-10
Lecture 5 —— LLM偏好调优全解:从RLHF人类反馈强化学习到DPO直接偏好优化
#LLM #RLHF #DPO #PPO #模型对齐
02-08
Lecture 4 —— LLM训练全流程解析:从预训练缩放规律到参数高效微调与模型对齐
#LLM #Attention #SFT #LoRA #模型对齐
02-06
Lecture 3 —— 大语言模型(LLM)核心技术与推理优化全解:从MoE架构到高效解码
#LLM #MoE #Prompt Engineering #CoT #KV Cache #推理优化
02-04
Lecture 2 —— Transformer进阶:位置编码演进、注意力优化技巧与BERT预训练微调全解
#Transformer #Attention #基础知识
02-02
Lecture 1 —— 从RNN到Transformer:NLP序列建模演进与编码器-解码器架构全解
#Transformer #Attention #基础知识
2025
25 posts
08-22
加密文档测试
#加密
08-20
LSTM & GRU —— 门控循环神经网络
#LSTM #GRU #门控机制 #梯度消失 #深度学习
08-18
RNN & BPTT —— 循环神经网络与随时间反向传播
#RNN #BPTT #梯度消失 #梯度爆炸 #梯度裁剪 #LSTM #深度学习
08-16
Residual Network —— ResNet残差网络
#ResNet #残差网络 #Bottleneck #梯度消失 #深度学习
08-14
CNN —— 卷积神经网络
#CNN #卷积神经网络 #感受野 #反向传播 #深度学习
08-12
Activation & Initialization —— 激活函数与权重初始化
#激活函数 #梯度消失 #ReLU #GELU #权重初始化 #深度学习
08-10
MLP & Back Propagation —— 多层感知机与反向传播
#MLP #反向传播 #计算图 #链式法则 #批处理 #深度学习
08-08
Autograd & Computational Graph —— 自动微分与计算图
#自动微分 #计算图 #链式法则 #深度学习
08-06
Gradient Descent Optimizer —— 梯度下降优化器
#梯度下降 #SGD #动量法 #AdamW #权重衰减 #深度学习
08-04
Probability & Information —— 概率论与信息论基础
#条件概率 #最大似然估计 #KL散度 #交叉熵 #贝叶斯先验 #深度学习
08-02
Tensor Operations —— 向量、矩阵与张量运算
#Tensor #张量 #矩阵乘法 #Hadamard积 #范数 #特征分解 #SVD #深度学习
07-22
K-Means Clustering —— 聚类算法
#K-Means #Lloyd算法 #EM算法 #聚类 #机器学习
07-20
XGBoost & LightGBM —— 梯度提升框架
#XGBoost #LightGBM #机器学习
07-18
Gradient Boosting Machine (GBM) —— 梯度提升机与加法模型
#梯度提升机 #GBM #加法模型 #机器学习
07-16
Bagging & Random Forest —— 随机森林
#Bagging #随机森林 #Bootstrap #集成学习 #机器学习
07-14
Decision Tree —— 决策树
#决策树 #信息增益 #基尼指数 #机器学习
07-12
Naive Bayes —— 朴素贝叶斯
#朴素贝叶斯 #生成式模型 #拉普拉斯平滑 #机器学习
07-10
K-Nearest Neighbor (KNN) —— K-近邻
#KNN #KD-Tree #Ball-Tree #机器学习
07-08
Kernel Trick —— 核技巧与常用核函数
#核方法 #核函数 #SVM #机器学习
07-06
Support Vector Machine (SVM) —— 支持向量机
#SVM #KKT条件 #核方法 #机器学习
07-04
Logistic Regression —— 逻辑回归与Softmax多分类
#逻辑回归 #Softmax #交叉熵损失 #梯度下降 #机器学习
07-02
Linear Regression —— 线性回归
#线性回归 #最小二乘法 #正则化 #机器学习
06-30
Docker 快速配置深度学习环境 + 基础命令 + 常见报错
#Docker #基础知识 #环境配置
06-28
开发基础工具 —— Conda、Pip/UV 与 Git 实战手册
#开发工具 #基础知识 #git #pip #uv #conda
06-26
命令行基础指令 —— Linux Shell 与 APT 包管理速查
#基础知识 #Linux #包管理