Zhang Haoyi
Hi, I'm Zhang Haoyi - HUST CS undergrad (2024). I'm an enthusiastic learner, developer and blogger. Welcome to my personal space where I share my thoughts, notes, projects, and experiences.
统计
74文章
8分类
223标签
目录
-
文章
-
ai_agent
- Agent Architecture —— LLM & Planning & Tool & Memory
- Agent Communication Protocols —— MCP & A2A
- Agent Engineering —— Prompt & Context & Harness & Loop
- Agent Paradigms —— ReAct & Plan-and-Solve & Reflection
- Function Calling —— 工具调用
- Memory Mechanisms Evolution: From Storage to Experience —— 智能体记忆机制的演化综述
- Memory System —— Agent记忆系统
- Multi-Agent System—— 多智能体系统
- Recursive Self-Improvement(RSI)—— 递归自我改进综述
- Retrieval-Augmented Generation —— 检索增强生成
- Self-Evolving Agents (What、When、How、Where) —— 自进化智能体综述
-
ai_alignment
- Comparison of RL Algorithm —— PPO、GRPO、DPO、DAPO、GSPO技术详解与对比
- DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization) -- 解耦裁剪与动态采样策略优化
- DPO (Direct Preference Optimization) -- 直接偏好优化
- GRPO (Group Relative Policy Optimization) -- 群体相对策略优化
- GSPO (Group Sequence Policy Optimization) -- 群组序列策略优化
- PEFT (Parameter-Efficient Fine-Tuning) —— 参数高效微调
- PPO(Proximal Policy Optimization) -- 近端策略优化
- Reinforcement Learning -- 策略梯度、优势函数、重要性采样与KL散度惩罚
- RLHF (Reinforcement Learning from Human Feedback) —— 基于人类反馈的强化学习
- RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习
- SFT (Supervised Fine-Tuning)—— 监督微调
-
ai_multimodal
- Contrastive Language-Image Pre-training —— CLIP对比学习
- Denoising Diffusion Probabilistic Models —— DDPM扩散模型
- Multimodal Large Language Model —— MLLM多模态大语言模型
- Multimodal RAG —— 多模态RAG
- Video Audio Multimodal —— 视频理解 & 视频生成 & 音频处理
- Vision Transformer —— ViT视觉Transformer
- Vision-Language Model —— VLM视觉语言模型
- Vision-Language-Action —— VLA具身智能
-
cs336
-
deep_learning
- Activation & Initialization —— 激活函数与权重初始化
- Autograd & Computational Graph —— 自动微分与计算图
- CNN —— 卷积神经网络
- Gradient Descent Optimizer —— 梯度下降优化器
- LSTM & GRU —— 门控循环神经网络
- MLP & Back Propagation —— 多层感知机与反向传播
- Probability & Information —— 概率论与信息论基础
- Residual Network —— ResNet残差网络
- RNN & BPTT —— 循环神经网络与随时间反向传播
- Tensor Operations —— 向量、矩阵与张量运算
-
machine_learning
- Adaptive Boosting (AdaBoost) —— 自适应提升
- Bagging & Random Forest —— 随机森林
- Decision Tree —— 决策树
- Expectation-Maximization Algorithm —— EM算法
- Gradient Boosting Machine (GBM) —— 梯度提升机与加法模型
- Hidden Markov Model (HMM) —— 隐马尔可夫模型
- K-Means Clustering —— 聚类算法
- K-Nearest Neighbor (KNN) —— K-近邻
- Kernel Trick —— 核技巧与常用核函数
- Linear Regression —— 线性回归
- Logistic Regression —— 逻辑回归与Softmax多分类
- Naive Bayes —— 朴素贝叶斯
- Principal Component Analysis (PCA) —— 主成分分析
- Support Vector Machine (SVM) —— 支持向量机
- XGBoost & LightGBM —— 梯度提升框架
-
-
相册
-
IB_Course
-
Calculus
-
Data Strctures
-
Discrete Mathematics
-
Physics Experiment
-
Physics(1)
-
Probability and Statistic
-
-
IIA_Course
-
Algorithm
-
Digital Circuits
-
Physics(2)
-
-
IIB_Course
-
Computer Organization
-
Database
-
MaoZedong
-
Signal and Linear Systems
-
-
Scenery
-
-
项目展示
-
CME295
-
CS336
-
分类
标签
SFT (Supervised Fine-Tuning)—— 监督微调
深入剖析监督微调(SFT)的核心原理,涵盖最大似然估计与交叉熵损失的数学推导、Loss Masking 代码实现、灾难性遗忘与不完全学习现象(ILP)等系统挑战,以及数据质量、分层学习率等最佳实践。全面理解 SFT 作为 LLM 后训练基石的定位、优势与演进方向。
3369 字
|
17 分钟
PEFT (Parameter-Efficient Fine-Tuning) —— 参数高效微调
系统解析PEFT技术体系,涵盖Adapter Tuning、Prefix Tuning、Prompt Tuning、LoRA、QLoRA、AdaLoRA、IA3等核心方法的数学原理、代码实现与选型指南,探讨低秩假设、矩阵分解、参数重参数化等深刻思想,以及前沿进展与未来方向。
3091 字
|
15 分钟
Multi-Agent System—— 多智能体系统
系统讲解多Agent协作的架构模式与决策协议:从单Agent的指令迷雾与工具过载问题出发,剖析顺序流水线、层级委托与对等协商三种协作模式的数学建模与适用场景;深入评估投票、共识与法官裁决三种决策协议的任务适配性;分析MAD多智能体辩论中多数投票的核心贡献与辩论本身的局限性,以及MoA混合智能体通过模型多样性实现性能提升的集成范式。
4301 字
|
22 分钟
Agent Communication Protocols —— MCP & A2A
系统讲解AI Agent通信协议MCP(模型上下文协议)与A2A(Agent2Agent协议)的定位差异、技术架构与协同方式。从MCP的客户端-服务器架构及其Tools/Resources/Prompts三种能力出发,到A2A的AgentCard发现机制与任务生命周期管理,通过六维对比分析揭示两者在连接对象、通信模式、扩展方式上的本质区别,并论证“MCP给Agent装备工具,A2A让Agent组网协作”的互补关系。
3247 字
|
16 分钟
Agent Engineering —— Prompt & Context & Harness & Loop 2026-04-12
系统剖析AI Agent工程从Prompt Engineering到Context Engineering再到Harness Engineering的三层演进路径:以数学公式形式化Prompt如何塑造条件概率分布、Context如何通过装配方程治理信息环境、Harness如何通过七层架构构建执行控制框架,并探讨Loop Engineering作为第四层延伸的嵌套关系。
4029 字
|
20 分钟
Memory System —— Agent记忆系统
系统讲解AI Agent记忆系统的架构设计与工程实践:从向量数据库作为记忆存储底座出发,剖析记忆生命周期的写入、检索、更新与遗忘策略,深入解读MemGPT如何借鉴操作系统分层内存管理思想将LLM上下文窗口视为“物理内存”、外部向量库视为“磁盘”以实现无限上下文幻觉,并介绍记忆压缩在有限空间中高效存活的机制。
4249 字
|
21 分钟
Retrieval-Augmented Generation —— 检索增强生成
系统讲解检索增强生成(RAG)的核心技术原理与工程实践:从文档分块的三种策略及其适用场景,到向量检索中ANN算法的数学原理与选型指南,再到重排序阶段Bi-Encoder与Cross-Encoder的架构差异及其对MRR/NDCG的量化提升,最后介绍HyDE如何通过“假设性文档”将检索从关键词匹配升级为意图理解。
4044 字
|
20 分钟
Function Calling —— 工具调用
系统讲解AI Agent工具调用的核心技术原理与工程实践:从JSON Schema的结构化约束机制出发,剖析Structured Outputs如何动态屏蔽非法token以保证输出匹配Schema;分析并行工具调用的延迟优势;深入解读tools与tool_choice的设计哲学;揭示工具描述撰写的核心技巧。
4916 字
|
25 分钟
Agent Paradigms —— ReAct & Plan-and-Solve & Reflection
系统剖析AI Agent的三大核心范式:ReAct(推理与行动交替的Thought-Action-Observation三拍循环)、Plan-and-Solve(先分解规划后逐步执行的两阶段架构)与Reflection(生成-批评-修正的自我优化机制)。从数学建模角度揭示ReAct如何通过外部观察修正条件概率分布、Plan-and-Solve如何将任务分解为子目标序列、Reflexion如何以“语义梯度”替代参数梯度实现零样本学习,并通过实验数据对比三种范式的适用场景与成本特征。
6016 字
|
30 分钟