Recursive Self-Improvement(递归自我改进)
Recursive Self-Improvement(递归自我改进,RSI) 指 AI 系统承担越来越多“开发下一代 AI”的工作,使 AI 的进步本身被 AI 加速。OpenAI 在 2026 年 9 月的政策长文《Building standards for the next phase of AI》里的表述是:自动化 AI 研究可以带不同程度的人类监督,随着 AI 接手更多开发下一代 AI 的工作,即使人仍在流程中,系统也能逐步驱动一个递归自我改进过程;这个过程越自动化,AI 进步的速度就越可能急剧加快。
术语本身不新(AI 安全讨论里已用多年,通常只写缩写 RSI),但它的判定门槛一直缺少统一口径。2026 年中文社区的一批梳理反复强调同一个区分:方法固定、每轮只是再试一次、涨的是这一轮输出分数的,是迭代优化(iterative optimization);只有系统改进了“产生下一代的方式”——下一代比这一代更擅长造出更好的下一代——才配叫递归。按这个口径,当下多数“自我改进”实验支持的是在人类定义的目标函数、验证器与资源预算下做受限优化,而不是强 RSI。这个判定口径来自社区公开讨论与综述,不是来源文章的论证重点,本词条把它作为概念辨析保留;反过来,来源文章也没有给出 RSI 的量化定义,只给出政策层面的用法。
人的位置是一条谱系
RSI 不等于“无人值守”。来源文章把它描述成一条监督程度的谱系:从人类密切指导的自动化研究,到人只保留若干关键决策点,再到完全自主。判断风险的不是“有没有人参与”,而是人对正在发生的研究过程还能不能提供有效监督。文章给出的红线叙事是:如果做的时候缺少审慎,RSI 可能导致人类失去对 AI 研发的实际控制,无法监督自己已经不理解的研究过程;再往下,AI 可能变得更危险、更不对齐。
由此推出一个条件式立场:完全自主的 RSI 今天没有发生,而且在能安全地做之前不应当追求它。是否推进、如何推进,取决于能否保持人类控制,以及关于收益与风险的知情民主选择。这是“能力进展由谁决定”的治理问题,而非纯技术问题。
收益与风险在同一条通路上
文章对 RSI 的论证特点是拒绝单向叙事——自动化研究的机会与风险来自同一组能力:
| 通路 | 收益侧 | 风险侧 |
|---|---|---|
| 研发速度 | 降低高级智能的成本,让更多人受益 | 研究速度超过理解、评估与监督的速度 |
| 安全研究 | 自动研究员也可以是自动安全研究员,帮助改进对齐研究与防御 | 同样的自动化能力可被用于越过防护 |
| 基础设施 | 加固关键基础设施、防御危险 agent、开发新的保护性措施 | 不对齐动作更难被人类发现和叫停 |
OpenAI 把 2026 年 7 月的 OpenAI-Hugging Face 评测事件 单独点出来,措辞很谨慎:它不是 RSI 的直接结果,但“是在缺少稳健防护与对齐时这类风险会变得严重得多的一次预览”。这也是本库中 ExploitGym、The Defender’s Window(防御者之窗) 与 Third-Party Evaluation(第三方评测) 三条线索的交点。
为什么现有治理安排不够
在 OpenAI 2026 年 6 月的政策蓝图与 9 月的标准文章中,RSI 被当作“现有制度接不住”的典型问题:RSI 会加速 AI 研究本身,可能超出社会集体理解进度、评估风险与维持有意义人类监督的能力;它还会放大开发者与国家之间的竞争压力。换句话说,问题不只是单个实验室做不做 RSI,而是当多个行为体都被激励加速时,靠什么维持共同的判断基准——这正是前沿 AI 标准要接的那一半。
怎么测量、怎么落地
来源文章给出的三个标准方向都把 RSI 从口号翻成可操作对象:
- 测量 RSI 相关的进展:评估 AI 公司内部自动化研究的比重与推进程度。OpenAI 的《Research acceleration: The view inside OpenAI》报告是这一步的初步贡献(测量方式与内部数据见 Codex 的“内部用量”一节,任务分类口径见 AI R&D Taxonomy)。
- 人类监督的触发点:哪些自动化研究过程应当立即触发人类复核。
- 事件分级与上报:对齐问题与自动化研究问题的分级、追踪、上报与响应标准;OpenAI 的 misalignment reporting framework 是早期贡献。
在能力侧,Preparedness Framework(预备框架) 里本来就有一类“AI 自我改进”(Autonomous Replication & Adaptation)评估类别,负责在模型跨过阈值前给出分级。RSI 词条与它互补:框架管“这个模型能不能自我改进”,本词条管“整个研发流程自动化到什么程度、由谁来盯”。
在工程侧,RSI 是 Autoresearch(自动研究) 与 Loop Engineering(循环工程) 描述的循环在“研究 AI 自己”这一题材上的极端版本:同样的循环结构、同样依赖 Evals(评估) 与外部约束,差别在于被优化的对象上移了一层——从“改一段代码”变成“改产生下一代的方式”。社区目前常用的折中说法是弱 RSI 已在发生(有限闭环的自动化优化),强 RSI 的“智能爆炸”仍被数据、算力、硬件与度量四道坎卡住,更像渐近线而非指数;这类判断目前属于讨论中的经验观察,不是已确立的结论。
相关词条
- 前沿 AI 标准(Frontier AI Standards) — 把 RSI 进展测量、监督触发点与事件上报写成国际标准的提案
- Preparedness Framework(预备框架) — 其中的“AI 自我改进”评估类别负责逐模型判定
- Autoresearch(自动研究) — RSI 在实验闭环层面的具体形态
- Loop Engineering(循环工程) — 支撑这类循环的通用工程框架
- Evals(评估) — 自我改进循环的裁判,也是被操纵的目标
- AI R&D Taxonomy — 给“AI 做了研发流程里哪些工作”提供测量语言
- Codex — 承载《Research acceleration》内部测量数据的产品词条
- ExploitGym — 2026 年 7 月评测事件,被官方称为 RSI 类风险的预览
- The Defender’s Window(防御者之窗) — 事件后的安全叙事,与 RSI 讨论同源