
Recursive Self-Improvement(RSI)—— 递归自我改进综述
系统解读递归自我改进(RSI)综述,围绕进化对象(参数、上下文、记忆、Skill、Harness代码)、进化结构(链、树、图)、更新来源(自身、教师、联合)、更新时机(离线、在线、混合)等维度建立 RSI 分类体系,并深入分析评估瓶颈、验证层级、L1-L5 自主性谱系、工业实践与开放挑战。
阅读文章ZHY's Blog
A UNIVERSE OF IDEAS · BY ZHANG HAOYI
让好奇心 点亮知识宇宙
在代码、模型与思想之间自由漫游。这里持续记录人工智能、机器学习、软件工程与成长实践,让每次阅读都成为一次新的发现。
ARTICLE NOTE
原文系统梳理了自进化智能体的定义、分类、方法、评估、应用与未来方向。本文聚焦四个核心问题:进化什么(What)、何时进化(When)、如何进化(How)、在哪里进化(Where),并辅以评估体系、开放挑战与未来方向的深度讲解。
大语言模型(LLM)在过去几年展现出惊人的通用能力:写代码、做推理、调用工具、进行多轮对话。但它有一个根本性限制:模型本身是静态的。训练完成后,参数不再变化。面对新任务、新知识、新环境,它只能依靠上下文、检索或外部脚手架,无法真正把经验写回自身。
这带来一个关键瓶颈:当 LLM 被部署到开放式、交互式、持续变化的环境中时,传统“预训练 + 微调 + 推理”的流水线不够了。人类工程师不可能为每一种新情况重新标注数据、重新训练、重新部署。智能体需要自己从交互中学习、从反馈中调整、从经验中进化。
“生存下来的不是最智慧的物种,也不是最强壮的物种,而是最能适应和调整自身以适应不断变化的环境的物种。” 达尔文的这句话点出了自进化智能体的核心精神:适应即智能。
操作性定义:自进化智能体是指能够基于自身轨迹或反馈信号,修改其内部参数、上下文状态、工具集或架构拓扑,并以改善未来性能为明确目标的智能体。
这个定义有三个关键纳入标准:
比较自进化智能体与四个相关范式:课程学习、终身学习、模型编辑、遗忘学习。
总结:自进化智能体是系统级解决方案范式,把适应作为一等能力,跨越参数、上下文、工具、架构多个层面。
环境:将智能体系统所处环境(包含用户、执行环境,例如 Linux 命令行)建模为部分可观测马尔可夫决策过程 POMDP:E=(G,S,A,T,R,Ω,O,γ),其中:
(多)智能体系统:定义为 Π=(Γ,{ψi},{Ci},{Wi})
Γ:智能体系统的控制流,或者多智能体协作结构,一般表示为图或者代码结构组织的节点序列 (N1,N2,...);每个节点 Ni 包含:
在每个节点,智能体策略为函数 πθi(⋅∣o),输入观测,输出下一个动作的概率分布;θi=(ψi,Ci)。动作空间是自然语言空间与工具空间 Wi 的并集。
给定任务 T=(E,g)(环境 E+ 目标 g∈G),智能体系统依照拓扑结构 Γ 生成轨迹 τ=(o0,a0,o1,a1,...),接收来自外部环境或者内部信号(例如模型置信度、评估器反馈)的反馈 r∗。
自演化策略:自演化策略是变换 f,基于生成轨迹 τ、外部 / 内部反馈 r,将当前智能体系统映射为新状态:
f(Π,τ,r)=Π′=(Γ′,{ψi′},{Ci′},{Wi′})
自演化智能体的优化目标:
U 为效用函数,用来衡量智能体系统 Π 在任务 T 上的性能,输出标量 U(Π,T)∈R。效用可以来自任务对应的反馈 r(奖励信号、文本评价),也可以结合其他性能指标(完成时间、准确率、鲁棒性)。
给定任务序列 (T0,T1,...,Tn) 与初始智能体系统 Π0,自演化策略 f 迭代生成一系列智能体系统:Πj+1=f(Πj,τj,rj) τj、rj 是智能体在任务 Tj 得到的轨迹和反馈。
设计自演化智能体的总目标:寻找策略 f,最大化全部任务累积效用:maxf∑j=0nU(Πj,Tj)
自演化智能体操作性定义:可以基于自身轨迹或反馈信号,修改自身内部参数、上下文状态、工具集、架构拓扑,明确目标是提升未来任务性能。
这个框架说明:自进化是一个递归过程,智能体在任务序列中不断把轨迹和反馈转化为新状态。理解这个框架后,我们就可以进入四个核心问题。

自进化智能体与静态智能体的区别,不在于它包含哪些组件,而在于哪些内部状态可以被自主修改。智能体系统可分解为四个支柱:模型、上下文、工具、架构。
模型是自进化的核心位点。传统做法依赖人工标注数据,成本高、覆盖窄。自进化模型则通过自生成监督、执行轨迹、环境反馈来更新参数。
静态 LLM 的能力边界在训练后就固定了。虽然 prompt engineering 可以引导行为,但它无法改变模型的内部表征。模型进化让智能体真正“把经验写进权重”,从而在复杂多步任务上获得持久提升。
主要方向
方向一:自挑战与自奖励
方向二:交互反馈直接更新
方向三:从环境中学习
Note模型进化的本质是:把推理、行动、反思的结果转化为参数更新信号。这比单纯 prompt engineering 更持久,也更接近“经验内化”。但代价是计算成本高、可能灾难性遗忘、需要小心安全对齐。
上下文是智能体最灵活、最低成本的进化位点。它不需要改权重,却可以直接改变行为。上下文进化分两类:记忆进化和提示优化。
记忆让智能体把过去经验存储、检索、蒸馏,指导未来决策。记忆进化分为四个层次。
层次一:结构化记忆管理
层次二:经验蒸馏
层次三:分层记忆
层次四:生成式记忆
Note记忆进化的关键不是“存更多”,而是把一次性经验转化为长期能力。好的记忆系统应该:选择性存储(不是所有东西都值得记) + 结构化组织(便于检索和推理) + 可泛化蒸馏(从具体到一般) + 动态更新(过时信息要删除)
提示优化让智能体精炼给模型的指令,无需改权重。提示优化分为四个方向。
方向一:搜索与进化
方向二:自包含优化
方向三:工作流级提示
方向四:多智能体提示
Note提示优化的本质是把语言本身当作可学习组件,与智能体经验共同进化。它的优势是低成本、可解释、无需改权重;局限是受上下文窗口限制,可能不够持久。
智能体的能力边界由工具定义。自进化工具的关键跃迁是:从使用预定义工具,到自主发现、创建、精炼、管理工具。工具进化分为三个方面。
探索式:Voyager 在 Minecraft 中通过试错构建技能库。它没有预定义工具列表,而是通过探索发现哪些动作有用,然后把它们写成代码技能。
反应式:ATLASS、Alita、Live-SWE-Agent 在发现能力缺口时,从零创建工具或检索开源代码。比如,当智能体需要计算某个统计量但没有现成工具时,它会搜索代码库或生成新代码。
结构化:
RL 集成:RL-GPT 把生成代码作为工具纳入 RL 流程。它动态适应环境:需要时生成新工具,不需要时直接执行简单动作。
安全挑战:自主创建工具带来风险:代码漏洞、恶意工具、隐私泄露。因此沙箱、静态分析、漏洞扫描、审批门变得关键。所有智能体生成或外部来源的工具必须在严格沙箱中执行。
新工具往往脆弱。LearnAct、From Exploration to Mastery 建立自纠正循环,让智能体从编译器错误、API 返回值、环境变化中学习,解决“信用分配”问题:哪行代码、哪个参数导致失败?这个过程不仅调试工具代码,还精炼工具文档。好的 docstring 和参数描述让智能体未来更容易正确使用工具。这形成正反馈:工具越好用,智能体越愿意用;越用,工具越完善。
人类协作也重要。许多系统设计“人在回路中”,人类专家可以提供修正、高层建议或验证新工具。这加速掌握过程,确保技能与人类意图一致。
当技能库达到数百上千,挑战从“创建”变成“管理”。
Note工具进化的目标是建立闭环:感知能力缺口 → 创建新工具 → 实践掌握 → 整合管理 → 继续扩展。 这个闭环让智能体从“工具使用者”变成“工具生态系统构建者”。
架构进化把智能体自身的逻辑和协作结构当作优化对象。分为单智能体和多智能体两个层面。
节点级优化:TextGrad 用文本梯度反向传播反馈。DSPy、Trace、LLM-AutoDiff 把工作流当作可微分程序,每个节点(LLM 调用)的参数(提示)可以联合优化。
拓扑搜索:AFlow、ADAS、MaAS 搜索或采样最优工作流。比如,AFlow 用蒙特卡洛树搜索探索“先检索再推理”还是“先推理再检索”哪种拓扑更好。
查询特定生成:ScoreFlow、FlowReasoner 用偏好优化或 RL 训练生成器,按查询动态构建工作流。简单问题用简单流程,复杂问题用复杂流程。
轻量评估:Agentic Predictor 训练预测模型,快速估计工作流性能,降低搜索成本。没有它,评估每个候选工作流都需要完整执行,太慢。
系统架构进化:
知识进化:
Note架构进化的核心是:把智能体自身的设计空间打开,让经验驱动结构变化。 这从“人设计智能体”走向“智能体设计智能体”,是通向 ASI 的关键一步。
| 进化位点 | 核心机制 | 代表方法 | 优势 | 挑战 |
|---|---|---|---|---|
| 模型 | 自生成监督、交互反馈、环境 RL | SCA, SELF, TextGrad, RAGEN | 持久、深入 | 成本高、遗忘、安全 |
| 上下文 | 记忆管理、经验蒸馏、提示优化 | Mem0, Expel, SPO, DSPy | 低成本、灵活 | 窗口限制、持久性 |
| 工具 | 自主创建、迭代精炼、管理选择 | Voyager, CREATOR, ToolGen | 扩展能力边界 | 安全、质量、管理 |
| 架构 | 节点优化、拓扑搜索、多智能体进化 | TextGrad, AFlow, EvoMAC | 系统级提升 | 搜索成本、可解释性 |
时间维度回答:进化发生在任务执行中,还是任务之间?区分两种模式:测试时内自进化和测试时间自进化。这个区分很重要,因为它决定了学习的数据可用性、优化目标和计算约束。
发生在任务执行期间。智能体识别当前问题上的局限,实时启动学习机制。
测试时内进化的特点:在线、即时、针对当前问题。它受时间约束,但能让智能体在部署中不中断地变强。
发生在任务完成之后。智能体提取反馈,改进未来性能。这是自主智能体更主流的学习过程。
测试时间进化的特点:回顾性、跨任务、面向分布泛化。它不受实时约束,可以更复杂地整合经验。
| 维度 | 测试时内 | 测试时间 |
|---|---|---|
| 时机 | 任务执行中 | 任务完成后 |
| 数据 | 动态生成 | 历史积累 |
| 目标 | 当前问题 | 未来分布 |
| 约束 | 实时性 | 计算资源 |
| 范式 | ICL, SFT, RL | ICL, SFT, RL |
| 代表 | Reflexion, AdaPlanner, LADDER | STaR, WebRL, DigiRL |
如何进化是方法学核心。三大范式:基于奖励、模仿/演示、种群/进化。它们依次解决前者的局限:奖励方法闭环但脆弱;模仿方法稳定但依赖演示;种群方法多样但成本高。
奖励信号决定学习方向。按反馈性质分四类。
文本反馈的优势:细微、可解释、样本高效。局限:可能有偏见、难以量化。
利用模型自身置信度、概率估计。
内部奖励的优势:无需外部监督。局限:可能自我欺骗、置信度校准不准。
来自环境、多数投票、规则。
外部奖励的优势:客观、可靠。局限:需要工程、表达力有限。
LLM 可以从非显式奖励信号中学习。
隐式奖励的优势:发现语言建模中固有的信号。局限:信号弱、难以控制。
奖励方法总结:显式优化、强自主,但对奖励设计敏感,可能奖励黑客。
模仿学习是规定性的:给智能体完整成功范例,让它复制。在自进化中,“专家”可以是智能体自己、其他智能体或环境合成。
模仿学习优势:样本效率高、稳定。局限:依赖演示质量,探索和泛化可能不足。
从生物进化汲取灵感:选择、交叉、变异、竞争。
从进化中学习:
自对弈:
系统架构进化:
知识进化:
种群方法优势:多样性、开放式发现。局限:计算成本高、可解释性低。
在线 vs 离线:
同策略 vs 异策略:
奖励粒度:
其他维度:
| 范式 | 反馈 | 优势 | 局限 | 代表 |
|---|---|---|---|---|
| 基于奖励 | 标量/语言/置信度 | 显式优化、自主 | 奖励设计敏感、黑客 | Reflexion, SELF, GRPO |
| 模仿/演示 | 完整轨迹 | 样本高效、稳定 | 依赖演示质量 | STaR, V-STaR, Sirius |
| 种群/进化 | 适应度/竞争 | 多样、开放 | 成本高、可解释低 | DGM, Absolute Zero, EvoMAC |
应用分为通用领域和专业领域。通用领域面向广泛任务,专业领域面向特定任务。
面向通用数字助手,提升广泛任务能力。三大机制:
| 领域 | 核心机制 | 代表 | 关键挑战 |
|---|---|---|---|
| 通用 | 记忆、协同进化、课程 | Mobile-Agent-E, UI-Genie, WebRL | 泛化、持续学习 |
| 编码 | 自编辑、多智能体、经验学习 | SICA, EvoMAC, AgentCoder | 代码质量、安全 |
| GUI | 自强化、反思、技能库 | WebVoyager, AutoGUI | 动作空间、视觉接地 |
| 金融 | 迭代精炼、反馈循环 | QuantAgent, TradingAgents | 市场动态、风险 |
| 医疗 | 模拟、记忆、RL | Agent Hospital, DoctorAgent-RL | 安全、隐私、责任 |
| 教育 | 个性化、自对弈 | PACE, MathVC | 学生隐私、教学效果 |
评估不能只看静态准确率。五个核心目标:适应性、保持性、泛化性、效率、安全性。
适应性:衡量通过经验在领域内改进的能力。
保持性:衡量知识稳定性,防止灾难性遗忘。
泛化性:衡量跨领域迁移。
效率:衡量资源利用。
安全性:衡量进化中是否出现不安全行为。
评估范式
标准化协议建议:短时程无状态持久,每任务预算 K_short,记录每迭代;长时程完全持久,阶段和累积预算,记录可重放轨迹、检查点、保持探测、进化决策日志。
个性化 AI 智能体
泛化性
安全可控
多智能体生态:平衡个体与集体推理,防止群体共识压制独立推理。高效框架与动态评估,现有基准静态,需动态评估角色适应和持续进化。
结语:自进化智能体的核心逻辑自进化智能体代表 AI 从静态模型向动态系统的范式转变。What 回答进化什么:模型、上下文、工具、架构。When 回答何时进化:测试时内、测试时间。How 回答如何进化:奖励、模仿、种群,以及在线/离线、同/异策略、奖励粒度等横切维度。Where 回答在哪里进化:通用助手、编码、GUI、金融、医疗、教育。
真正的挑战不只是让智能体变强,而是让它在持续进化中保持稳定、安全、可控、可泛化。灾难性遗忘、偏好对齐、协同进化、环境漂移、评估标准化,都是通往人工超级智能路上的关键关卡。
本文价值在于提供了一个统一框架:把分散的方法组织成 What、When、How、Where 四维坐标。研究者可以用它定位自己的方法,从业者可以用它设计系统,评估者可以用它构建基准。自进化智能体不是单一技术,而是一种系统级能力:从经验中学习,从反馈中调整,从交互中成长。这条路通向的,是更自适应、更鲁棒、更通用,也更需要谨慎治理的智能体未来。
按顺序完成这组文章,循序渐进地掌握主题
发现错误、内容过时或有改进想法?欢迎告诉我
根据本文分类与标签,为你推荐可能感兴趣的内容

系统解读递归自我改进(RSI)综述,围绕进化对象(参数、上下文、记忆、Skill、Harness代码)、进化结构(链、树、图)、更新来源(自身、教师、联合)、更新时机(离线、在线、混合)等维度建立 RSI 分类体系,并深入分析评估瓶颈、验证层级、L1-L5 自主性谱系、工业实践与开放挑战。
阅读文章
系统梳理 LLM Agent 记忆机制从 Storage、Reflection 到 Experience 的演化框架。解析长期一致性、动态环境与持续学习三大驱动,剖析主动探索与跨轨迹抽象两大变革机制,并展望主动记忆感知、工作记忆、经验基准、分布式共享记忆与多模态记忆等未来方向。
阅读文章
系统讲解AI Agent的核心架构——LLM(推理引擎)、规划(Planning)、工具(Tools)与记忆(Memory)四大模块的设计原理与协同机制。从感知-规划-行动闭环出发,剖析LLM作为“中央推理引擎”的多重角色、规划的数学建模与两种范式、工具调用的标准化接口与MCP协议演进,以及短期记忆与长期记忆的二分法设计。
阅读文章请使用微信扫描二维码分享
当前文章会保持在原页面