vLLM:大模型推理系统的分页内存革命
系统梳理vLLM大模型推理系统的核心技术原理,解析PagedAttention的分页内存管理、连续批处理与分块预填充等创新机制,揭示其如何通过系统架构革新实现2-24倍的吞吐量提升。
3454 words
|
17 minutes
Multi-Agent System—— 多智能体系统
系统讲解多Agent协作的架构模式与决策协议:从单Agent的指令迷雾与工具过载问题出发,剖析顺序流水线、层级委托与对等协商三种协作模式的数学建模与适用场景;深入评估投票、共识与法官裁决三种决策协议的任务适配性;分析MAD多智能体辩论中多数投票的核心贡献与辩论本身的局限性,以及MoA混合智能体通过模型多样性实现性能提升的集成范式。
4301 words
|
22 minutes
Agent Communication Protocols —— MCP & A2A
系统讲解AI Agent通信协议MCP(模型上下文协议)与A2A(Agent2Agent协议)的定位差异、技术架构与协同方式。从MCP的客户端-服务器架构及其Tools/Resources/Prompts三种能力出发,到A2A的AgentCard发现机制与任务生命周期管理,通过六维对比分析揭示两者在连接对象、通信模式、扩展方式上的本质区别,并论证“MCP给Agent装备工具,A2A让Agent组网协作”的互补关系。
3247 words
|
16 minutes
Agent Engineering —— Prompt & Context & Harness & Loop 2026-03-12
系统剖析AI Agent工程从Prompt Engineering到Context Engineering再到Harness Engineering的三层演进路径:以数学公式形式化Prompt如何塑造条件概率分布、Context如何通过装配方程治理信息环境、Harness如何通过七层架构构建执行控制框架,并探讨Loop Engineering作为第四层延伸的嵌套关系。
4029 words
|
20 minutes
Memory System —— Agent记忆系统
系统讲解AI Agent记忆系统的架构设计与工程实践:从向量数据库作为记忆存储底座出发,剖析记忆生命周期的写入、检索、更新与遗忘策略,深入解读MemGPT如何借鉴操作系统分层内存管理思想将LLM上下文窗口视为“物理内存”、外部向量库视为“磁盘”以实现无限上下文幻觉,并介绍记忆压缩在有限空间中高效存活的机制。
4249 words
|
21 minutes
Retrieval-Augmented Generation —— 检索增强生成
系统讲解检索增强生成(RAG)的核心技术原理与工程实践:从文档分块的三种策略及其适用场景,到向量检索中ANN算法的数学原理与选型指南,再到重排序阶段Bi-Encoder与Cross-Encoder的架构差异及其对MRR/NDCG的量化提升,最后介绍HyDE如何通过“假设性文档”将检索从关键词匹配升级为意图理解。
4044 words
|
20 minutes
Function Calling —— 工具调用
系统讲解AI Agent工具调用的核心技术原理与工程实践:从JSON Schema的结构化约束机制出发,剖析Structured Outputs如何动态屏蔽非法token以保证输出匹配Schema;分析并行工具调用的延迟优势;深入解读tools与tool_choice的设计哲学;揭示工具描述撰写的核心技巧。
4916 words
|
25 minutes
Agent Paradigms —— ReAct & Plan-and-Solve & Reflection
系统剖析AI Agent的三大核心范式:ReAct(推理与行动交替的Thought-Action-Observation三拍循环)、Plan-and-Solve(先分解规划后逐步执行的两阶段架构)与Reflection(生成-批评-修正的自我优化机制)。从数学建模角度揭示ReAct如何通过外部观察修正条件概率分布、Plan-and-Solve如何将任务分解为子目标序列、Reflexion如何以“语义梯度”替代参数梯度实现零样本学习,并通过实验数据对比三种范式的适用场景与成本特征。
6016 words
|
30 minutes
Agent Architecture —— LLM & Planning & Tool & Memory
系统讲解AI Agent的核心架构——LLM(推理引擎)、规划(Planning)、工具(Tools)与记忆(Memory)四大模块的设计原理与协同机制。从感知-规划-行动闭环出发,剖析LLM作为“中央推理引擎”的多重角色、规划的数学建模与两种范式、工具调用的标准化接口与MCP协议演进,以及短期记忆与长期记忆的二分法设计。
4956 words
|
25 minutes
Lecture 9 —— LLM多模态泛化与前沿探索:从ViT/VLM跨模态适配到扩散LLMs与未来发展趋势
系统梳理大语言模型在跨模态与前沿技术方向的核心进展,涵盖Transformer多模态泛化本质、ViT与VLM的视觉适配方案、扩散LLMs(MDM)的并行生成突破、跨模态技术交叉融合(扩散架构/Transformer/MSRoPE/DeepSeek-OCR)、LLM基础研究趋势(帕累托优化/类存内计算)及应用场景与未来展望,最后提供学术与工程跟进渠道。
3729 words
|
19 minutes