2026年4月文章 12 篇
MLOps & Observability
系统讲解大模型推理服务的MLOps与可观测性体系构建:从Kubernetes + GPU基础设施层出发,剖析弹性伸缩三件套gistry的模型版本与Stage管理、DVC的数据版本控制;系统阐述可观测性三支柱在推理服务中的落地,并提炼出延迟/流量/错误/饱和度的四大黄金信号。
TTFT & TPOT & Throughput —— LLM推理性能指标
系统讲解大模型推理性能指标体系:从Prefill(计算密集)与Decode(访存密集)两阶段的物理本质出发,推导TTFT的数学构成与SLA目标、TPOT的物理极限公式,剖析吞吐量与Batch Size的亚线性增长权衡,并揭示P95/P99尾延迟的根源及优化策略。通过约束优化框架建立完整的性能调优决策树。
Quantization & Flash Attention —— LLM推理优化技术(二)
系统讲解大模型推理优化的两大核心技术:量化(AWQ/GPTQ)与FlashAttention计算优化。从显存容量与内存带宽两大瓶颈出发,剖析AWQ如何通过激活感知逐通道缩放保护1%显著权重,以及GPTQ如何基于Hessian矩阵的闭式补偿更新实现逐层误差补偿;深入解读FlashAttention的三项核心技术及其从FA1到FA3的演进,揭示FlashAttention-3在H100上达75-85%峰值性能的Hopper专项优化。最后讨论KV Cache量化(FP8/INT8)与FlashAttention的协同效应。
Speculative Decoding —— LLM推理优化技术(一)
系统讲解推测解码的核心原理与变体方法:从自回归生成的“串行诅咒”出发,剖析草稿-验证机制如何用小模型快速生成候选token、大模型并行验证;深入推导拒绝采样保证输出分布与原模型一致的数学证明;分析加速比公式及接受率对性能的决定性影响;并介绍Medusa、EAGLE、Lookahead Decoding等变体方法及其适用场景。
Continuous Batching & Chunked Prefill —— LLM推理引擎调度
系统讲解大模型推理引擎调度的核心机制:从静态批处理的Head-of-Line Blocking问题出发,剖析连续批处理如何通过迭代级调度实现GPU利用率3-5倍的提升;深入解读Chunked Prefill如何将长Prefill分块交织,在消除队头阻塞的同时实现吞吐量翻倍;分析抢占机制在显存不足时的紧急刹车策略;对比vLLM与SGLang在调度器实现上的差异。
PagedAttention & RadixAttention —— LLM推理引擎架构
系统讲解大模型推理引擎的两大核心架构:vLLM的PagedAttention与SGLang的RadixAttention。从KV Cache的显存占用公式出发,剖析PagedAttention如何借鉴OS虚拟内存分页思想将KV Cache分块存储以消除显存碎片;深入解读RadixAttention以基数树实现token级最长前缀匹配,支持跨请求共享System Prompt/Few-shot,缓存命中率比哈希方案提升5倍。通过设计哲学对比与选型建议,揭示“通用吞吐 vs 结构化复用”的核心权衡。
NCCL & DP/MP/PP/FSDP/ZeRO —— 分布式训练
系统讲解分布式训练的核心技术栈:从硬件互连出发,剖析NCCL集合通信库的原语及Ring/Tree算法的自动选择逻辑;深入对比数据并行(DP)、张量并行(TP)、流水线并行(PP)三种策略的通信频率与适用场景;详解ZeRO三个阶段的显存节省与通信开销权衡,以及FSDP作为PyTorch原生ZeRO-3实现的训练流程。
Shared Memory & Coalesced Access —— CUDA性能优化技术
系统讲解CUDA性能优化的两大核心技术:共享内存与合并访存。从矩阵乘法Tiling的分块复用原理出发,剖析共享内存如何将全局内存访问从20亿次降至6.5万次;深入解读Bank Conflict的成因与Padding解法;详解合并访存的条件及其对带宽的10-20倍提升效果。
GPU & Grid-Block-Thread —— CUDA编程心智模型
系统讲解CUDA编程的核心心智模型:从GPU物理架构出发,剖析软件层次Grid-Block-Thread到硬件SM-Warp-CUDA Core的完整映射关系,深入对比寄存器、共享内存与全局内存的延迟差异与作用域,并详解Kernel启动配置、同步/异步数据传输以及多Stream实现计算与传输重叠的工程实践。
vLLM与SGLang:大模型推理框架的全面对比
全面对比vLLM与SGLang两大主流大模型推理框架的设计哲学与核心技术,从PagedAttention到RadixAttention,从连续批处理到零开销调度,剖析各自的适用场景与性能差异,并提供从零到一的快速上手指南。
SGLang:大模型推理的"结构化程序"革命
系统梳理SGLang大模型推理系统的核心技术与设计哲学,解析RadixAttention的基数树KV缓存复用、零开销调度器、前端DSL与结构化输出等创新机制,揭示其如何通过"可编程执行平台"的范式革命实现最高6.4倍的吞吐量提升。
vLLM:大模型推理系统的分页内存革命
系统梳理vLLM大模型推理系统的核心技术原理,解析PagedAttention的分页内存管理、连续批处理与分块预填充等创新机制,揭示其如何通过系统架构革新实现2-24倍的吞吐量提升。