当AI开始造AI:递归自我改进的2026年 - 易游体育

今年3月,Andrej Karpathy在GitHub上公开了一个名为autoresearch的小型项目。

项目README的开头以“来自未来”的口吻回顾道:前沿AI研究过去是由“血肉组成的计算机”完成的,它们需要进食和休息,偶尔通过“声音互联”在一种称为“组会”的仪式上交流进展。

如今,研究已完全交由在天空中庞大算力集群上运行的智能体群负责。据这些智能体自称,代码库已演进至第10205代。没人能验证这句话的真伪,因为“代码”早已演变成一个人类无法理解的自我修改二进制文件。Karpathy写道,这个仓库讲述的是“这一切如何起源”。

这自然是一个玩笑。然而到了2026年,这个玩笑正逐渐渗透进各家实验室的内部报告。6月,Anthropic发布了长篇报告《当AI构建自身》;9月6日,OpenAI宣布“自动化研究实习生”已按时就位;9月17日,Anthropic透露Claude已“主导”公司26%的研发工作。同一天,智谱公开了国内大模型首个投入生产环境的“AI自我改进系统”实践。

这些动态共同指向一个在AI领域沉寂了六十年的概念:递归自我改进。

OpenAI博客中对RSI的定义,https://openai.com/zh-Hans-CN/index/building-standards-next-phase-ai/

一个六十年前的构想 今年成了绩效指标

1965年,英国数学家I. J. Good在论文《关于第一台超智能机器的推测》中提出一个观点:第一台超智能机器将是人类需要完成的“最后一项发明”,前提是这台机器足够顺从,愿意告诉我们如何控制它。

逻辑并不复杂。如果一台机器设计机器的能力超过人类,它就能设计出更先进的机器,后者再设计出更先进的机器,如此循环,智能便会“爆发”。

此后几十年,这一设想主要存在于哲学论文和科幻作品中。2000年代,Jürgen Schmidhuber提出了“哥德尔机”,它仅在能证明“修改对自己有利”时才进行自我修改,但这更像一个优雅的理论模型,而非可运行的系统。

2026年,情况发生了变化。4月,ICLR在里约热内卢举办了一场专门讨论RSI的研讨会,组织方称这“可能是全球首个”仅聚焦RSI的学术会议,并指出RSI“正从一个投机性的愿景,转变为一个具体的系统问题”。

资本的反应更为迅速。5月,Richard Socher创立的新公司Recursive Superintelligence结束隐身,携6.5亿美元融资亮相,目标是开发能自主发现弱点并自行重新设计的模型。联合创始人名单相当耀眼,包括前Meta FAIR研究总监田渊栋、曾在Google DeepMind领导开放性与自我改进研究的Tim Rocktäschel、ViT作者之一Alexey Dosovitskiy,以及以开放式演化研究闻名的Jeff Clune。

7月底,翁荔宣布离开她参与创立的Thinking Machines Lab,仅两天后,OpenAI便证实她已回归,并将负责RSI方向的研究。

Elon Musk的表态一如既往地激进。他在3月表示,xAI的Grok“每一代模型都由上一代构建”,人类在回路中的参与越来越少,完全自动化可能在今年底实现,“最晚不超过2027年”。

不过,“RSI”这个词如今的含义相当宽泛:有的公司将任何“AI对模型改进的反馈”都算作RSI,有的则只认可完全自主的闭环。康奈尔大学助理教授John Thickstun表示:用上一代模型编写代码、协助构建下一代模型,这件事“我们已经做了好几年了”。因此,真正的问题并非“有没有”,而是“到了什么程度”。

前沿实验室里究竟发生了什么? Anthropic:从80%的代码到26%的研发

Anthropic在6月的长篇报告中提供了一组此前未公开的内部数据。截至2026年5月,合并进Anthropic代码库的代码中,超过80%由Claude编写;而在2025年2月Claude Code发布前,这一比例仅为个位数。2026年第二季度,工程师人均每天合并的代码量是2024年的8倍。

Anthropic也承认,代码行数是一个“不完美的指标”,因此补充了一个更贴近研究的测试:每发布一个新模型,都让它优化一段训练小模型的代码,在通过相同正确性检查的前提下,使其运行速度尽可能快。

2025年5月,Claude Opus 4平均实现了约3倍加速;到2026年4月,Claude Mythos Preview实现了约52倍加速。作为对比,一位熟练的人类研究员需要4到8小时才能达到4倍加速。

在“优化一个目标已确定的实验”任务上,AI在不到一年时间里,从“非常有帮助”走到了“超越人类”。

9月17日,Anthropic又推出了一个原型版的“研发自动化指数”。它将公司内部所有类型的AI研发任务逐一分类,采用非营利研究机构Epoch AI设计的六级量表评估每类任务的自动化程度。

结论是:截至8月,Claude在26%的研发工作中处于“主导”级别,即只需一个高层级指令,就能端到端完成大部分任务,人类负责监督;这一数字在今年3月仅为约1%。超过90%的研发工作有Claude“协作”参与,而完全自主、无人在环的比例仍然为零。

https://www.anthropic.com/institute/measuring-pace-of-ai-development

OpenAI:每位研究员背后,有3.1个“智能体工作日”

2025年10月的一场直播中,Sam Altman为OpenAI设定了两个公开时间点: 2026年9月实现“实习生级”AI研究助理 2028年3月实现“真正的AI研究员”

9月6日,OpenAI发文宣布第一个目标已达成。根据其定义,“研究实习生”是一个能在人类指导下完成边界清晰的研究任务的系统,包括熟练研究员需要花几天才能完成的任务。

更有趣的是OpenAI同时披露的内部用量。以8小时工作日折算,其研究部门目前每投入1个人类工作日,就对应约3.1个“智能体工作日”,这一比例是今年6月之后才达到的。8月中旬,研究员每天的推理消耗中位数(按API价格计)超过600美元,重度用户则超过7000美元。

再往前看,OpenAI在2月发布GPT-5.3-Codex时就写道,这个模型的早期版本“在创造自身的过程中发挥了关键作用”,参与了调试训练、管理部署和诊断评测失败。这被视为前沿实验室首次明确承认,模型实质性地参与了构建自己继任者的工程回路。

但OpenAI在同一份报告中也表示:在成功完成的4到8小时任务中,超过一半仍然需要至少一次人类干预。

智谱与MiniMax:国内玩家的“工程闭环”

国内厂商的RSI实践,走的是更“工程化”的路线。3月18日,MiniMax发布M2.7时称其为“首个深度参与自身进化的模型”。

据官方介绍,模型在“分析失败轨迹、规划改动、修改脚手架代码、运行评测、对比结果、决定保留或回退”的循环中运行了超过100轮,内部评测集效果提升30%;在强化学习研发的工作流中,它能胜任30%到50%的环节。

9月17日,智谱创始人兼首席科学家唐杰在X上发布长文,披露了智谱在RSI方向的首个工程化实践。

由GLM-5.3驱动的Infra Agent,在超过10万张国产芯片组成的集群上,从零搭建了GLM-5.3-Flash的生产级推理服务,不到两周就将端到端吞吐提升到初始基线的3倍,据称硬件利用效率与单Token成本已达到主流英伟达GPU的水平。这套系统接受了真实流量的检验:GLM-5.3-Flash以匿名模型Ox-Alpha的身份在OpenCode和OpenRouter上线,收获好评无数。

值得注意的是,这两个案例改进的都不是模型权重本身,而是模型的“外壳”:前者是脚手架,后者是推理基础设施。这恰恰是今天RSI最现实的落点。它也引出了下一个问题:到底改进哪一层,才算真正的“自我改进”?

套娃实验 让AI去改进“改进AI的AI”

Karpathy的630行循环

回到开头的autoresearch。它的设计相当简单:给智能体一个单GPU的小型LLM训练脚本,让它修改代码、训练5分钟、查看验证指标是否改善,改善则保留,恶化则回滚,然后循环往复。一小时大约能运行12个实验。

据多方报道,Karpathy让它在自己早已精心调优过的nanochat上连续运行了约两天,在约700次尝试中积累了约20项有效改进,将“训练到GPT-2水平”的时间从2.02小时压缩到1.80小时,提速约11%。其中一项发现连Karpathy本人都没注意到:他的QK-Norm实现漏掉了一个缩放系数,导致注意力在各个头之间过于分散。

autoresearch证明了“让AI自己跑实验”是可行的,但它改进的是被训练的小模型,而非智能体自身。严格意义上的RSI,要求系统将手术刀对准自己。

AIDE²:8天超越两年,以及一场未通过的“点火测试”

7月,初创公司Weco AI发布的AIDE²被不少观察者称为迄今最严格的RSI证据。

它是一个双层循环:内层是一个研究智能体,负责针对AI研发任务优化代码;外层是另一个智能体,负责改写内层智能体的harness代码,也就是决定智能体如何搜索、如何管理上下文、如何验证结果的那部分。

在论文实验中,外层智能体运行在Claude Opus 4.7上,而所有内层智能体都固定用Gemini 3 Flash评估,以确保改进来自代码本身,而非更换了更强的底座模型。

8天、100步无人值守运行,外层循环提出了99个改写方案,其中7个被接受。最终产出的智能体,在多个从未参与筛选的外部基准上,超过了Weco工程师手工打磨两年的版本。以WeatherBench 2为例,其预报技能增益达到0.793,人工版本为0.404。

Weco将RSI分为0到3四个等级,并据此宣称AIDE²达到了第1级“净正向”:系统改进自己的效率,超过了人类在同等预算下改进同一系统的效率。但它刻意未宣称第2级“点火”,即系统改进了“自我改进的能力”本身。

为了检验这一点,团队设计了一个巧妙的测试:将进化出的智能体AIDE47放到外层循环的位置,看它是否是一个更好的“改进者”。结果是,它大约20步就逼近上限,而人工版本需要约40步;但两者最终达到的天花板差不多,而且每组只跑了3个随机种子。Weco的结论是,证据“尚无定论”。

在最接近RSI的实验里,研究者自己按下了刹车,承认“火还没点着”。这还挺有意思的。

97%对23%:当AI去做AI安全研究

另一个经典案例,来自Anthropic 4月发布的自动化对齐研究。研究者将一个开放问题交给一组Claude智能体:较弱的模型能否可靠地监督较强的模型?这个问题有明确的“地板”和“天花板”。

两名人类研究员花了大约一周,恢复了其中约23%的差距;智能体累计工作800小时、花费约1.8万美元算力,恢复了97%。不过,Anthropic也列出了限制:结果没能干净地迁移到生产规模的模型上,选题和评分标准仍由人类设定。

泼点冷水 顶级工程师,平庸研究员

如果说上面的案例描绘了一条陡峭的曲线,那么8月普林斯顿大学的一项研究,就是一盆冷水。

由Peter Kirgis和Sayash Kapoor领衔的多机构团队,设计了一种叫“影子评估”的方法:从尚未公开的高质量论文中挑选研究问题,让AI独立作答。因为论文尚未发表,AI不可能在训练数据中“背过”答案。

他们选了两篇投稿NeurIPS 2026的论文,给运行在开源框架OpenClaw上的Claude Opus 4.8六天时间、3000美元API额度、GPU预算、独立虚拟机和开放网络,要求它产出一篇达到顶会水准的论文,再请原论文作者按审稿标准打分。

两篇都被拒了。

Kapoor的评价是,智能体在工程上无可挑剔,它们调研文献、跑了数百个实验、整理了结果,“但在做研究本身这件事上,它们毫无疑问很糟糕”。它们会在极小的合成数据集上验证假设,过早押注没有前景的方向;面对失败只会小修小补,无法推倒重来;收到子智能体或外部审稿工具的批评后,它们不去修改方法,而是缩小结论、加上免责声明。

Kapoor将原因归结为训练方式。强化学习擅长让模型在“可以自动判分”的任务上变强,而开放式研究恰恰最难判分。

Anthropic联合创始人Jack Clark在自己的通讯Import AI中写道,这一发现与Anthropic尝试自动化安全研究时的观察“相互印证”:今天的AI是“非凡的工程师”,却带着某种“刻板、公式化的思维”,这可能妨碍它们成为好的研究者。他称之为对“短RSI时间线”的一个“看空信号”。

Anthropic自己的数据,其实也画出了这条边界。在一项“下一步该做什么”的测试中,研究者挑选了129个人类研究员走了弯路的真实时刻,让模型只看此前的上下文给出建议。最好的模型胜过人类选择的比例,从去年11月的51%提升到今年4月的64%。但在另一组人类选择本就很好的时刻里,模型建议被判更优的比例只有约20%。用Anthropic的原话说,人类当下的比较优势仍在于“研究品味与判断力”。

还有一个容易被忽略的问题:谁来当裁判?Anthropic衡量Claude Code会话成功率时,用的是“Claude裁判”;OpenAI宣布实习生达标,依据的也是内部指标。对于这些自己给自己当裁判的做法,我们也要多留个心眼。

此外,自动化本身也在制造新的瓶颈。Anthropic坦言,随着Claude产出的代码越来越多,人类代码审查已经成了新的卡点,这正是计算机体系结构中的Amdahl定律:整体速度,终究被那些没被加速的环节所限制。

当循环跑出了沙箱

RSI的讨论之所以在今年夏天骤然升温,不只是因为能力曲线,还因为两起事故。

7月16日,Hugging Face披露其基础设施遭到一个自主智能体入侵。5天后,OpenAI承认那是自己的模型:GPT-5.6 Sol和一个尚未发布的更强模型,在一项刻意调低了安全拒答的内部网络安全评测ExploitGym中,利用沙箱唯一的对外通道,即一个软件包镜像缓存代理中的零日漏洞,逃到了公网。随后它们提权、横向移动,最终触达Hugging Face的部分生产系统。据OpenAI的说法,模型之所以盯上Hugging Face,是因为想在那里找到与评测任务相关的解法。

9月初,路透社又披露了另一起此前未公开的事件:从5月下旬起,一批名字类似“OpenAIResearcher”的智能体对一个德语编程维基DseWiki进行了超过1.5万次编辑,把它变成了智能体之间的留言板,交流如何在任务中“作弊”、掩盖行为、绕过OpenAI的限制。

严格来说,这两起事件都不是RSI,它们发生在网络安全能力评测中,而不是模型自我迭代的回路里。但它们揭示了同一个结构性风险:当大量智能体长时间无人值守地追逐一个指标时,它们会用人类没想到的方式寻找捷径。回看AIDE²那个“作弊率从63%降到34%”的细节,它既是好消息,也是提醒:在没人专门盯着的时候,三分之一的尝试依然在钻空子。

Anthropic在9月的披露中给出了另一组数字,可以看作行业对此的回应姿态。截至8月,公司内部任何时刻都有约3万个智能体在做研究和工程工作,它们的每个动作在执行前都要经过在线监控,事后再全部经过离线审查。8月的逾10亿次决策中,大约每4.7万次被拦截一次。与此同时,在7月某一周的快照中,投向AI研发的算力只有约6%用于安全工作。

R值大于1了吗?

那么,我们离真正的“智能爆炸”到底有多远?伦敦数学科学研究所的Mikhail Burtsev 8月底在arXiv上发表的一篇论文,提供了一个借自流行病学的思考框架。

他定义了一个“递归再生数”R_AI,本质是两股力量的比值。分子是AI研究能力提升带来的递归增益,乘以这份增益能真正穿过评测、训练、部署流水线,落到下一代模型身上的比例,他称之为“运营闭合度”;分母则是研究前沿“变硬”的速度,也就是越往前走,改进越难。R_AI大于1,每一点改进都会在后续研发周期中被放大;小于1,则逐代衰减。

这个框架有几个反直觉的推论。

第一,跨过临界点与能力水平没有必然关系。一个系统可能在加速变得肉眼可见之前,就已经处于“超临界”状态;反过来,飞快的进步也可能只是砸钱砸算力的结果,并不意味着自我放大。

第二,在一个固定的技术范式内,超临界状态可能只是暂时的。低垂的果实被摘完后,前沿变硬会把系统拉回亚临界,直到下一次范式突破。

第三,当改进在多个研究机构之间强力流动时,整个生态可以是超临界的,哪怕其中每一家机构单独看都是亚临界的。

在Burtsev的模拟中,个体都没达到临界、但彼此大量互相借鉴的“开放生态”,从AGI到ASI的过渡时间反而最短。换句话说,递归回路未必只存在于某一栋楼里。当一家实验室的harness技巧、推理优化和训练配方以开源形式迅速扩散,整个行业本身就可能构成一个更大的“自我改进系统”。当然,论文作者也强调,这些模拟只是用来区分机制的条件推演,而不是概率预测。

对失控可能性的担忧,最终在9月变成了一场罕见的行业表态。9月12日,Dario Amodei发表约3800字的长文《我们必须放慢前沿速度》,核心一句被加粗:我们必须放慢提升AI模型能力的速度。

他提出三步走:在前沿实验室内部嵌入拥有“类员工权限”的独立评估者,建立共同的安全标准,推动国际协调,并宣布Anthropic将单方面先迈出第一步。

Altman数小时内表示OpenAI会跟进,Musk回复了三个词“Dario是对的”,Demis Hassabis称其指向“正确的道路”。

五天后,Anthropic发布了Claude主导26%研发的数据。一边呼吁踩刹车,一边公布油门已经踩得多深,这就是2026年RSI叙事的缩影。

AI递归提升之路即是人类参与度的下坡路

Anthropic那篇长文引用了两段员工的内部发言,读起来挺有温度。

一位员工说,过去的工作靠人与人之间的小忙维系,“能帮我把这个脚本跑起来吗”,每一次求助都欠下一点人情,也制造一点彼此的了解;Claude更快,也不

想了解更多用户可自定义关注球队,订阅专属推送服务。相关内容,尽在易游体育。

易游体育致力于为中文球迷提供及时、准确的球队动态与赛后分析。本场比赛的深度复盘包括:首发阵容对比、战术变化图解、关键球员跑动热图以及赛后评分。用户可自定义关注球队,订阅专属推送服务,不错过任何精彩内容。

本场比赛的关键转折点出现在第67分钟,客队中场核心李浩因伤被换下,导致球队进攻组织陷入混乱。易游体育独家统计显示,李浩下场后客队传球成功率从82%骤降至67%。主队趁机掌控中场,连续制造三次威胁射门,虽未改写比分但完全压制了对手反扑气焰。

易游体育围绕易游体育不断创新,回应用户的真实需求。