
Recursive Self-Improvement(RSI)—— 递归自我改进综述
系统解读递归自我改进(RSI)综述,围绕进化对象(参数、上下文、记忆、Skill、Harness代码)、进化结构(链、树、图)、更新来源(自身、教师、联合)、更新时机(离线、在线、混合)等维度建立 RSI 分类体系,并深入分析评估瓶颈、验证层级、L1-L5 自主性谱系、工业实践与开放挑战。
阅读文章ZHY's Blog
A UNIVERSE OF IDEAS · BY ZHANG HAOYI
让好奇心 点亮知识宇宙
在代码、模型与思想之间自由漫游。这里持续记录人工智能、机器学习、软件工程与成长实践,让每次阅读都成为一次新的发现。
ARTICLE NOTE
参考综述:From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms
本文将以这篇综述为主线,系统梳理 LLM Agent 记忆机制为什么演化、如何演化、经验阶段带来了什么变革,以及未来可能走向何方。希望为研究者、工程师和产品设计者提供一张清晰的“记忆演化地图”。
过去两年,大语言模型LLM的进步让智能体Agent从“会聊天”走向“会规划、会调用工具、会与环境交互”。但一个根本问题始终存在:LLM 本身是无状态的。它可以在一次上下文窗口内表现得非常聪明,却很难天然地记住上一次任务发生了什么、哪些尝试失败了、哪些策略成功了,也很难在长时间跨度上保持目标一致。
于是,记忆机制成为 LLM Agent 的架构基石。没有记忆,智能体就像每次醒来都失忆的人:它可以临时推理,却无法积累经验;可以完成单步任务,却难以在复杂环境中持续进化。
然而,当前关于 LLM Agent 记忆的研究非常碎片化。一派从操作系统工程出发,把记忆当作存储、缓存、检索和上下文管理问题;另一派从认知科学和心理学出发,试图模拟人类记忆的形成、巩固、遗忘和检索。两种视角各有价值,却缺少统一框架。考虑用“演化”视角把记忆机制分为三个阶段:
一句话概括:Storage 记住发生了什么,Reflection 判断什么值得记住,Experience 提炼未来该怎么做。
LLM 的本质是一个条件概率模型:给定上下文,预测下一个 token。它的参数在推理时是冻结的,不会因为一次对话而自动更新。这意味着:
LLM 的无状态性会阻碍智能体在复杂、多步任务中保持逻辑一致性,并妨碍其从先前交互中学习,导致重复推理错误。因此,记忆机制不是锦上添花,而是让 Agent 能够稳定运行、持续学习的关键组件。
当前记忆机制研究大致有两条路线:
这两条路线各有优势,但它们缺乏协同,导致研究碎片化。工程路线擅长可扩展性和系统实现,却可能忽略认知层面的抽象;认知路线擅长解释性和仿生设计,却可能难以工程化。
把记忆机制的发展形式化为三个阶段:
这三个阶段不是完全替代关系,而是演化叠加。一个高级记忆系统可能仍然保留存储层,但同时具备反思和经验抽象能力。这种视角帮助我们理解:记忆不只是“存得更多”,而是“信息密度更高、抽象层次更高、迁移能力更强”。
首先形式化 LLM Agent 的决策过程:
关键是:全局记忆库 M 和当前检索到的记忆实例 mt 不是一回事。记忆机制的核心任务,就是如何构建、维护和检索 M。
记忆可定义为“外化存储库”,它桥接模型参数中冻结的知识与不断变化的环境动态。即记忆不是模型参数本身,而是模型外部可读写的结构化信息。
在此基础上,三个阶段有了形式化定义:
这意味着:Storage 是“原始日志”,Reflection 是“带批注的日志”,Experience 是“方法论手册”甚至“直觉”。
长期一致性是 Agent 在真实世界部署的前提。LLM 在局部上下文内可以保持连贯,但在多步交互中容易冗余探索、累积错误、目标漂移。从两个维度分析:
因此,早期记忆机制主要解决“记住”的问题:把历史交互保存下来,让 Agent 在长任务中不迷失。
真实环境不是静态基准。知识具有时间有效性,因果关系具有延迟和级联效应。
这意味着,记忆不能只是“过去日志”,还要能表达“什么时候有效”“为什么导致什么”。
持续学习是终极需求。开放世界必然遇到训练分布之外的情况。如果 Agent 不能把记忆内化为可复用知识,就会陷入重复试错。
这三个驱动共同推动记忆从“静态记录”走向“动态管理”,再走向“自主抽象”。
Storage 是起点,目标是解决上下文窗口有限与交互历史无限之间的矛盾。Storage 分为三类:线性、向量、结构化。
线性存储把交互轨迹当作按时间排序的 token 流,通常用 FIFO 管理。研究重点有两个:
线性存储简单直接,但容量有限,且压缩是机械的,不涉及语义抽象。
向量存储把轨迹编码到高维空间,极大扩展容量,但重点转向检索优化:
向量存储提高了召回能力,但检索到的内容仍被视为扁平历史证据,缺乏抽象。
结构化存储用显式数据结构组织记忆,超越线性容量和向量模糊性:
结构化存储支持多跳推理和复杂查询,但构建和维护成本更高。
Storage 阶段的核心价值:让 Agent 有历史可查,有状态可依。但它无法判断记忆质量,错误和幻觉也会被一起保存。
Reflection 阶段的核心是:记忆不再被动保存,而是主动评价、纠错和精炼。Reflection 分为内省、环境和协调三类。
内省反思利用 LLM 自身知识评估和修正记忆,不需要外部反馈。三条路径:
内省反思能减少幻觉和逻辑错误,但可能受限于模型自身知识,无法保证与事实一致。
环境反思用外部环境信号作为锚点:
环境反思能提高事实一致性,但依赖环境反馈的质量和频率。
协调反思把反思扩展到多智能体:
协调反思适合复杂任务,但通信成本和一致性维护是挑战。
Reflection 阶段的核心价值:让记忆从“原始日志”变成“高质量知识”。但它仍然是轨迹局部的,难以跨任务迁移。
Experience 是最高层,目标是跨轨迹抽象,把相似轨迹压缩为通用规则或策略先验。Experience 分为显式、隐式、混合三类。
显式经验是人类可读、可编辑、可泛化的经验:
显式经验可解释、易复用,但可能面临存储膨胀和检索延迟。
隐式经验把交互历史内化到模型参数或潜变量:
隐式经验推理开销低、上下文限制小,但可解释性差,更新成本高。
混合经验建立“积累—内化”循环:
混合经验试图兼顾灵活性和效率,是未来重要方向。
Experience 阶段的核心价值:让 Agent 从“记住具体经历”走向“提炼可迁移智慧”,实现零样本迁移和持续进化。
反思 vs 经验:关键区别
- Reflection 把精炼单元 mi′ 注入回记忆库,辅助未来相似任务;
- Experience 提取单独规则集 K,作为未见场景的策略先验。
也就是说,Reflection 是轨迹局部精炼,Experience 是跨轨迹抽象。Reflection 让记忆更干净,Experience 让记忆更通用。
Experience 阶段的两个变革:主动探索和跨轨迹抽象。
主动探索让 Agent 从被动记录者变成目标驱动的经验收集者。探索不再随机,而是由记忆引导,结果再抽象回记忆。
探索机制:
探索维度:
主动探索的意义在于:Agent 不再只是“遇到什么记什么”,而是“为了学会什么去主动尝试什么”。
跨轨迹抽象把孤立轨迹压缩为通用模式,形成稳定策略先验。它让 Agent 超越具体动作序列,在更高抽象维度决策。
抽象机制:
抽象粒度:
探索与抽象形成反馈循环:探索产生新轨迹,抽象提炼规则,规则指导下一步探索。这是 Agent 自主持续进化的核心引擎。
主动记忆感知:
工作记忆组织:
经验基准:
分布式共享记忆:
多模态记忆:
此外,也包含局限:缺乏统一基准和定量比较;经验阶段与微调、强化学习、元学习有交叉;时间覆盖有近因偏差。
结语:从存储到经验,走向持续学习的 Agent本文用演化视角统一了碎片化的记忆研究:
- Storage 解决“记住”的问题;
- Reflection 解决“记好”的问题;
- Experience 解决“会用”的问题。
未来 LLM Agent 的竞争力,不仅取决于模型参数有多大,更取决于记忆机制有多强。
一个真正持续学习的 Agent,应该能够主动探索、跨轨迹抽象、按需检索、动态遗忘、多模态整合,并在多智能体社会中共享共识记忆。
从存储到经验,记忆机制正在从“外部硬盘”进化为“第二大脑”。而这条演化路径,可能正是 LLM Agent 走向通用人工智能的关键一步。
按顺序完成这组文章,循序渐进地掌握主题
发现错误、内容过时或有改进想法?欢迎告诉我
根据本文分类与标签,为你推荐可能感兴趣的内容

系统解读递归自我改进(RSI)综述,围绕进化对象(参数、上下文、记忆、Skill、Harness代码)、进化结构(链、树、图)、更新来源(自身、教师、联合)、更新时机(离线、在线、混合)等维度建立 RSI 分类体系,并深入分析评估瓶颈、验证层级、L1-L5 自主性谱系、工业实践与开放挑战。
阅读文章
系统解读自进化智能体综述,围绕 What、When、How、Where 四大核心问题,系统梳理自进化智能体的进化对象(模型、上下文、工具、架构)、进化时机(测试时内/测试时间)、进化方法(奖励/模仿/种群)与落地领域,并涵盖五维评估体系、开放挑战与未来方向。
阅读文章
系统剖析AI Agent的三大核心范式:ReAct(推理与行动交替的Thought-Action-Observation三拍循环)、Plan-and-Solve(先分解规划后逐步执行的两阶段架构)与Reflection(生成-批评-修正的自我优化机制)。从数学建模角度揭示ReAct如何通过外部观察修正条件概率分布、Plan-and-Solve如何将任务分解为子目标序列、Reflexion如何以“语义梯度”替代参数梯度实现零样本学习,并通过实验数据对比三种范式的适用场景与成本特征。
阅读文章请使用微信扫描二维码分享
当前文章会保持在原页面