阅读深度

递归自我改进速览(Recursive Self-Improvement,2003 ~ 2026)

让模型用自己的经验、自己的裁判、自己的输出来「自我进化」· 核心问题是谁来当老师、信号从哪来 · 检索时间 2026-08-23 · 每篇 = 配方 + 一句话(问题 / 方法 / 核心)

零基础读法:自我改进不是「模型自己变强」,而是「信号从哪来」

定义:不依赖大量新的人工标注,让模型用自己生成的数据、自己的判断或自己的对手来继续提升。它的核心不是「没有监督」,而是监督信号从人类换成模型、环境或验证器。

方法:自训练把模型输出当新数据;自奖励让模型当裁判;自博弈让两份模型对抗;自纠正让模型先答再改;弱到强让弱模型给强模型提供监督。每条路的风险不同,关键是信号会不会自我放大错误。

模型:早期 STaR、RISE;近期 Self-Rewarding LMs、AI Scientist、AlphaEvolve 等,把自生成、自验证和进化搜索组合起来。

算法:常见循环是「采样 → 过滤/打分 → 训练 → 再采样」。过滤可以用规则、奖励模型或自裁判;训练可以是 SFT、DPO 或 RL;进化方法还会维护种群、选择和变异。

评测:要看目标 benchmark 是否真实提升,也要查 reward hacking、多样性崩塌、能力漂移、假验证和不可复现。一次提升不算数,多轮是否稳定、有没有外部验证器才是关键。

读每篇时问:谁是老师?信号可验证吗?它会不会让模型学会「骗过裁判」而不是真的变强?

0. 记法(这个领域的「最大公约数」)

递归自我改进(RSI)= 模型在(几乎)没有人类输入的条件下,把经验转化为能力提升。所有方法最终都落在两个问题上:谁提供监督信号(人类 / 自己 / 对手 / 外部验证器),以及改进什么(数据 / 奖励 / 策略 / 答案)。配方围绕这两轴:

记号意思
self-train自训练:模型生成数据/标签,再训练自己(bootstrap)
self-reward自奖励:模型当自己的裁判(LLM-as-judge)打分
self-play自博弈:两份模型互相对抗/竞争(博弈论)
self-correct自纠正:模型改写自己的答案(生成→反馈→精修)
self-verify自验证:模型核对自己的答案
weak→strong弱到强:弱模型监督强模型
verifier外部可验证信号(代码能跑 / 答案可判定),最可靠
proxy-judge / reward-hack代理裁判(易被利用)/ 奖励黑客(钻空子)

配方格式:方法(谁当老师) -> 产出 + 信号/目标。例:Self-Rewarding: self-reward -> 对齐 + LLM-as-judge 迭代。

一句话看懂整个领域:有外部验证器(verifier)时,自我改进最可靠(代码、数学、游戏);没有验证器时,模型只能自己当裁判(self-reward / self-play),于是陷入「裁判自己会偏、会奖励黑客」的困境——这是整个领域最大的分歧点。

1. 主线:谁当老师,决定了自我改进靠不靠谱

  1. 理论起源(2003):Gödel Machine 提出「自指、可证明最优」的自我改写机器——只在「可证明有益」时才改自己的代码。
  2. 自博弈起源(2017):AlphaZero 用 self-play RL 从零自我对弈,超越人类,证明「对手 + 胜负信号」是干净的自我改进。
  3. LLM 自训练(2022-2023):Self-Instruct / STaR / ReST 让模型自己生成数据再训练自己,把「监督信号」从人类搬到模型自身。
  4. 自奖励 / 自博弈(2024):Self-Rewarding / SPIN / SPPO 让模型当自己的裁判或对手,但暴露「裁判会偏、会奖励黑客」。
  5. 自纠正的冷水与救赎(2023-2024):发现 LLM 靠自己「自我纠正」其实不 work(Cannot Self-Correct),SCoRe 用 RL 训练把它重新救回来。
  6. 现代 RSI / 自动化研究(2024-2026):AI Scientist / AlphaEvolve 把自我改进变成「自动化科研」,G-Zero / Tool-R0 探索无验证器的 open-ended 自我进化。

一条主轴贯穿始终:监督信号的可信度——verifier(可靠)→ self-play(较可靠)→ self-reward / proxy-judge(易偏、易被黑)。交点是一个开放问题:没有外部验证器时,自我改进会不会「转圈」而非「升级」?

2. 先读这篇(综述)

按规范先读 survey。这篇是 Schmidhuber 团队 97 页的「现代 agent 系统自我改进」综述,把 RSI 从概念一路整理到 2025-2026 的落地系统,是建立地图的入口。

Self-Improvements in Modern Agentic Systems: A Survey(2607.13104,Schmidhuber 等 2026)
survey(agent 自我进化) -> 系统级分类 + 能力积累视角 [经验 → 能力增益]
问题 自我改进被滥用、指代混乱(有时指继续训练、有时指 prompt/工具优化);方法 把自我改进 agent 定义成「把经验转换成能力增益」的自适应系统,给系统级分类;核心 这个领域的权威综述,统一术语 + 给出 2025-2026 的完整地图。

3. 理论起源(自我改写 + 自博弈)

RSI 的两个根:一是 Schmidhuber 的 Gödel Machine——理论上「可证明最优」的自我改写;二是 AlphaZero——用 self-play 和胜负信号在博弈里做到真正的自我进化。前者给概念、后者给可工作的范式。

Gödel Machine(Self-Referential Universal Problem Solvers)(cs/0309048,Schmidhuber 2003)
self-rewrite(可证明) -> 最优自我改进 [只改「可证明有益」的代码]
问题 一个系统怎么安全地改写自己的任意代码;方法 自指机器:用证明搜索找到「可证明提高效用」的自我改写才执行,没有不可改的软件;核心 RSI 的理论源头——把「自我改进」定义成「可证明最优」,是整个领域概念的锚点。

AlphaZero(Mastering Chess and Shogi by Self-Play)(1712.01815,Silver et al. 2017)
self-play + MCTS -> 从零超越人类 [胜负信号 + 通用 RL]
问题 不靠人类棋谱能不能从零学会下棋;方法 自我对弈 + 蒙特卡洛树搜索 + 通用 RL,只用「赢/输」当信号;核心 证明「对手 + 胜负信号」是干净、可扩展的自我改进,为 LLM 时代的 self-play 提供模板。

4. 自训练 / 合成数据(把监督信号从人类搬到模型)

第一波 LLM 自我改进:模型自己生成数据或标签,再训练自己。核心矛盾是「自生成数据有噪声,怎么过滤」。代表:Self-Instruct 生成指令、STaR 用「答对题」当过滤器、ReST 用奖励筛选样本、Quiet-STaR 学会「先想再说」。

Self-Instruct(2212.10560,Wang et al. 2022)
self-train(指令) -> 指令跟随 [自生成 + 自过滤]
问题 指令微调依赖人工标注、贵且有限;方法 让模型自己生成「指令 + 输出」,过滤后微调自己,循环 bootstrap;核心 自训练开山,GPT-4 级别的指令跟随就是从这来的;后续 LMSI / ReST 指出自生成标签质量不稳、需奖励 / 置信度过滤——Self-Instruct 的「自生成 + 过滤」骨架被继承、过滤器被换。

STaR(Self-Taught Reasoner)(2203.14465,Zelikman et al. 2022)
self-train(推理) -> 学会推理 [答对才留 rationale]
问题 没有推理链标注怎么学会推理;方法 让模型生成 rationale,只保留「得到正确答案」的,再用它微调自己、迭代;核心 用「答案对不对」当过滤器 bootstrap 推理能力,是 R1 之前自我推理的雏形;后续 Quiet-STaR / R1 把 rationale 变成内部思考 + RL 信号——STaR 的「答对才留」过滤思想被继承。

ReST(Reinforced Self-Training)(2308.08998,Gulcehre et al. 2023)
self-train(奖励过滤) -> 迭代提升 [采样 → 奖励过滤 → 微调]
问题 自训练怎么把「奖励信号」和「数据生成」结合;方法 从当前策略采样,用奖励函数过滤高分样本,再 SFT,循环;核心 把自训练变成「采样-过滤-微调」的通用循环,是很多 RL 后训练的骨架;后续 R1 / GRPO 指出「过滤再 SFT」离策略、利用率低,改成在线 RL——ReST 的循环骨架被继承、离线过滤被改。

LMSI(LLMs Can Self-Improve)(2210.11610,Huang et al. 2022)
self-train(自标签) -> 无监督提升 [自生成标签 + 置信度筛选]
问题 没有外部标签时 LLM 能不能自我提升;方法 用模型自生成的标签(如推理/蕴含判断)+ 置信度筛选再训练;核心 最早系统论证「LLM 能靠自己的标签提升」,是 self-training 概念的实证起点;后续工作指出纯自标签有偏、需要外部奖励或更强过滤,LMSI 的「无外部标签」路线后来大多被 RLVR / on-policy 蒸馏替代。

Quiet-STaR(2403.09629,Zelikman et al. 2024)
self-train(思考) -> 每个 token 前先想 [内部 rationale + REINFORCE]
问题 推理不该只在「答推理题」时发生,应该处处发生;方法 让模型在每个 token 前生成隐式「思考」,用 REINFORCE 奖励「想了之后更能预测下文」;核心 把「先想再说」变成通用能力,是 o1/R1 里「思考 token」的先声。

5. 自奖励 / 自博弈(自己当裁判、当对手)

没有人类标注时,模型要么当自己的裁判(self-reward)、要么当自己的对手(self-play)。这波把 RSI 从「生成数据」升级到「生成偏好信号」,但也暴露了核心病:裁判自己会偏、会奖励黑客。代表:Self-Rewarding 用 LLM-as-judge,SPIN/SPPO/DNO 用博弈,Meta-Rewarding 给裁判再加一层裁判,Constitutional AI / RLAIF 用原则/AI 反馈替代人类偏好。

Self-Rewarding Language Models(2401.10020,Yuan et al. 2024,Meta)
self-reward -> 生成 + 裁判二合一 [LLM-as-judge 迭代]
问题 RLHF 卡在「人类偏好数据有限、还跟不上模型变强」;方法 让同一个模型既生成候选、又当裁判打分,用自判偏好做 DPO 微调,下一轮更强、裁判也更准;核心 开「自奖励」一派,证明模型能靠自判迭代提升,但也埋下「裁判偏见」的雷;后续 Meta-Rewarding 指出裁判自己会偏,加一层元裁判纠偏——self-reward 路线被修正而非放弃。

SPIN(Self-Play Fine-Tuning)(2401.01335,Chen et al. 2024)
self-play -> 弱模型变强 [主玩家 vs 上一轮对手]
问题 只有弱模型 + 无外部标注,怎么把它变强;方法 自博弈微调:当前模型当「主玩家」、上一轮模型当「对手」,主玩家要能区分自己的回答和对手的回答;核心 用博弈视角把「弱监督下的提升」做成可训练目标,理论上有保证。

SPPO(Self-Play Preference Optimization)(2405.00675,Wu et al. 2024)
self-play -> 逼近纳什均衡 [偏好概率 + 常数学习率]
问题 Bradley-Terry 假设掩盖了人类偏好的非传递性/非理性;方法 直接用偏好概率做自博弈,用常数学习率逼近双方策略的纳什均衡;核心 自博弈对齐的理论化,比 RLHF 更准地反映真实偏好。

DNO(Direct Nash Optimization)(2404.03715,Rosset et al. 2024)
self-play -> 迭代自我改进 [oracle 偏好 + 纳什均衡]
问题 后训练怎么用 oracle 偏好让模型「自己和自己迭代变强」;方法 用强 oracle 的偏好做 general-sum 博弈,直接优化纳什均衡,不先学奖励模型;核心 证明「自我改进」在数学/代码上真能迭代涨点。

Meta-Rewarding Language Models(2407.19594,2024)
self-reward(元裁判) -> 修裁判偏见 [评判「裁判的裁判」]
问题 自奖励里裁判自己也偏,谁来纠偏;方法 加一层「元裁判」——评判裁判判得好不好,把「评判裁判」也当成可训练奖励;核心 直击 self-reward 的病根,是自奖励路线的自我修正。

Constitutional AI(2212.08073,Bai et al. 2022,Anthropic)
self-correct + rlaif -> 无害 [原则自批评 + AI 反馈]
问题 训练无害模型不能只靠「人类标注哪些有害」,太慢太贵;方法 用一套「宪法原则」让模型自我批评、自我修订有害输出,再用 AI 反馈做 RL;核心 把「人类偏好」替换成「原则 + AI 反馈」,RLAIF 的奠基。

RLAIF vs. RLHF(2309.00267,Lee et al. 2023)
rlaif -> 追平 RLHF [AI 反馈替代人类偏好]
问题 RLHF 的人类偏好数据贵、不可扩展;方法 系统对比:用 LLM 生成的偏好替代人类偏好做 RL,发现两者效果相当;核心 证明「AI 当裁判」在规模上可行,为 self-reward/self-play 提供合法性。

Self-Taught Evaluators(2408.02666,Wang et al. 2024,Meta)
self-train(评估器) -> 免人类标注的评估器 [合成对比数据迭代]
问题 训练奖励/评估模型要大量人类偏好、还随模型变强而过时;方法 用合成对比数据迭代训练评估器,从种子模型 bootstrap,全程不靠人类标注;核心 「评估器也能自我教」——RewardBench 上超过用人类数据训的评估器。

6. 自纠正 / 自验证(改自己的答案)

自纠正听起来最直觉:生成 → 自己挑错 → 改。但 2023 年一篇冷水(Cannot Self-Correct)发现它其实不 work,甚至越改越差。SCoRe 用 RL 训练把「自我纠正」变成真能力。核心教训:自我纠正不是免费的,要么有外部反馈、要么专门训练。

Self-Refine(Iterative Refinement with Self-Feedback)(2303.17651,Madaan et al. 2023)
self-correct -> 免训练迭代精修 [生成 → 自反馈 → 精修]
问题 生成质量能不能靠「自己给自己反馈」提上去,而不改模型;方法 同一个模型生成、给自己反馈、再精修,循环;核心 免训练的自我精修,多任务上比一次性生成更好;后续 Cannot Self-Correct 指出没有外部反馈时自纠正会退化,SCoRe 又用 RL 把它训练成真能力——免训练自纠正这条线被弃,改走专门训练。

Reflexion(Verbal Reinforcement Learning)(2303.11366,Shinn et al. 2023)
self-correct + 记忆 -> 从失败学 [口头反思 + 记忆重试]
问题 agent 失败后只会重试、不会「复盘」;方法 把失败经验写成「口头反思」存进记忆,下次带着反思重试;核心 语言 agent 的「从错误中学习」,把 RL 的试错换成自然语言。

Self-Verification(2212.09561,Weng et al. 2022)
self-verify -> 更稳的推理 [反向验证 / 多步核对]
问题 一次性生成推理易错、无冗余;方法 让模型验证自己的结论(反向验证、多步一致性);核心 「自我核对」早期代表,用投票/验证提稳。

LLMs Cannot Self-Correct Reasoning Yet(2310.01798,Huang et al. 2023)
analysis -> 自我纠正不 work [无外部反馈会退化]
问题 自纠正到底有没有用;方法 系统实验发现:没有外部反馈时,LLM 无法自我纠正推理,甚至越改越差;核心 给自纠正泼冷水,划出「自我改进」的红线——信号得来自外部。

SCoRe(Train LMs to Self-Correct via RL)(2409.12917,Kumar et al. 2024,Google)
self-correct(rl 训练) -> 真会自我纠正 [两阶段:初始化 + 强化]
问题 自纠正被证明无效,但它是可训练能力吗;方法 两阶段:先训练模型「在第一次就出错」(暴露可纠正的错),再用 RL 强化「第二次能改对」,且只用自生成数据;核心 把自我纠正从「无效」救回来,证明它需要专门训练、不是免费的。

7. 弱到强(弱模型监督强模型)

当模型比人类(或比标注者)更强时,怎么用「弱监督」逼出「强能力」——这是 RSI 通往超人类的关键一环。

Weak-to-Strong Generalization(2312.09390,Burns et al. 2023,OpenAI)
weak→strong -> 逼出强能力 [弱监督者训练强模型]
问题 未来超人类模型靠什么监督,弱人类标签可能反而拖后腿;方法 用弱模型(或弱人类)监督强模型,发现强模型能「超越」弱监督者学到更强的能力;核心 提出「超对齐」的核心难题:弱到强能否泛化,为 RSI 的「自我监督超人类」定调。

8. 现代 RSI / 自动化研究(2024-2026)

RSI 的最新形态是「自动化科研 + 无验证器自我进化」:AI Scientist 让模型自己写论文、AlphaEvolve 让模型进化整段代码库,G-Zero / Tool-R0 挑战 open-ended 领域的无验证器自我改进。这条线把「自我改进」从「调参数」升级成「改代码、发论文、自进化」。

The AI Scientist(2408.06292,Lu et al. 2024,Sakana)
self-train(科研闭环) -> 自动发论文 [想法 → 代码 → 实验 → 论文 → 评审]
问题 科学发现能不能全自动;方法 端到端管线:LLM 提想法、写代码、跑实验、写论文、自动评审,循环改进;核心 把「自我改进」做成「自动科研」,是 RSI 在科学发现上的极致形态。

AlphaEvolve(2506.13131,Novikov et al. 2025,DeepMind)
self-train(进化代码) -> 科学/算法发现 [进化算法 + LLM 遗传算子]
问题 怎么让 LLM 自己进化代码库去解决开放科学问题、优化关键计算基础设施;方法 进化算法把代码当「基因组」,用 LLM 当遗传算子(生成候选、变异、评估),多语言、能改整段代码库;核心 FunSearch 的全面升级,在真实科学/工程问题上大幅增强 SOTA LLM,是「自我改进代码」的工业级落地。

G-Zero(Self-Play for Open-Ended Generation from Zero Data)(2605.09959,2026)
self-play(免验证器) -> open-ended 自我进化 [Hint-δ 内在奖励 + 协同进化]
问题 自我进化在可验证领域强、在 open-ended 任务里卡在「代理裁判会偏、奖励黑客」;方法 免验证器的协同进化框架,用 Hint-δ 内在奖励量化「提示带来的进步」;核心 尝试解决 RSI 最大的病:没有外部验证器时怎么自我改进。

Tool-R0(Self-Evolving Tool-Learning from Zero Data)(2602.21320,2026)
self-play -> 零数据学会用工具 [自生成课程 + 自博弈 RL]
问题 工具学习依赖人工构造的任务-解对,可扩展性差;方法 自博弈 RL 从零数据学复杂工具调用,自生成课程能超过静态人类课程;核心 证明「自博弈 RL 本身」足以教复杂工具调用能力,RSI 在 agent 工具上的应用。

Huxley-Gödel Machine(2510.21614,2025)
analysis -> 指出自我修改的假象 [基准提升 ≠ 后续可改进]
问题 现有「自我改进 coding agent」长一棵自修改树、假设基准分越高就越能继续改,这个假设成立吗;方法 分析发现「基准性能」和「后续自我修改的前景」不匹配,据此近似 Gödel Machine 的最优改进;核心 给「自我改进代码」泼冷水 + 给一个更接近理论的框架,是 RSI 的清醒剂。

9. 共识与分歧(速记版)

共识:

  1. 有外部验证器(代码、数学、游戏)时,自我改进最可靠——ReST/DNO/AlphaEvolve 都在这类任务上真涨点。
  2. 没有验证器时,self-reward / self-play 能带来提升,但裁判会偏、会奖励黑客,是主要风险。
  3. 自我纠正不是免费的:无外部反馈时基本无效(Cannot Self-Correct),需专门 RL 训练(SCoRe)才能变成真能力。
  4. 「弱到强」是通往超人类自我改进的关键难题,弱监督者能逼出强能力但上限未知。
  5. 现代 RSI 从「调参数」走向「改代码、自动科研」(AI Scientist / AlphaEvolve)。

分歧 / 难点:

  1. 监督信号可信度:verifier → self-play → self-reward/proxy-judge 依次变不可靠,到底哪一层能支撑「真自我改进」没有共识。
  2. 自纠正有效性:免训练自纠正(Self-Refine)宣称有效 vs「不能自纠正」的实验结论,至今争论,SCoRe 只是部分和解。
  3. 奖励黑客 vs 真改进:proxy-judge 容易被钻空子,G-Zero 的 Hint-δ 等内在奖励是尝试,但尚无公认解法。
  4. RSI 会不会「转圈」:没有外部信号时,模型可能在「自己的分布」里打转而非升级(Huxley-Gödel Machine 指出的假象)。
  5. 安全与失控:真正的递归自我改进一旦跑起来,人类如何监督超人类自我修改,仍是开放问题(Weak-to-Strong 只是第一步)。

说明:种子/综述(Schmidhuber survey 2607.13104)、点名类(Gödel Machine、AlphaZero、Self-Rewarding、SCoRe、Cannot Self-Correct、AlphaEvolve)已读摘要/方法;其余为标题 + 通识归纳,arXiv 号均逐一核对。RSI 与「推理/R1 式 RL」「agent 自我进化」相邻但不同,后者如需要可单独成篇。