跳到主内容
MK体育入口

VC追着投的RSI究竟是什么?姚顺宇、施天麟与清华/上交的教授们给出了回答

2026-09-21 · 刘冬梅 · 更新于 2026-09-23

文|王欣逸

编辑|张雨忻

RSI(递归式自我改进)正变得异常火爆。

周六,在上海西岸,汇聚了一群最顶尖的人类大脑,以及那些试图让AI也具备聪明大脑能力的人。

在大洋彼岸,数月未曾公开露面、声称Gemini 3.8 Flash是“RSI的一大步”的姚顺宇,正在电话那头等待;成立仅半年、估值已达46.5亿美元、专注于AI自进化的硅谷创业公司Recursive Superintelligence,其联合创始人施天麟,也参与了这场讨论。

他们共同聚焦于一个话题:资金不断涌入的RSI赛道,正在发生哪些变化?

RSI,即Recursive Self-Improvement,自今年年中以来成为最热门的话题之一。它指的是AI能够自我改进自身,从编写代码、运行实验,到调整架构、优化权重,甚至自行设定新目标。

现场绝大多数参与者是研究员,来自各大企业、高校和实验室,也有不少知名投资机构、FA和孵化器到场。我们全程参与了这场长达五个小时的活动,一些构想和争议在会场中反复出现。

大家正在构想一个人类无需介入的终局——即人类不再参与模型自我改进的循环,并探讨大厂、实验室和创业公司如何探索和实现这一目标。

不同的声音也随之浮现——自进化是否是一个悲观的未来?最终是否会被模型厂商所吞没?RSI是否不需要预训练,也不应该是一个垂直模型?

关于如何定义、评估和验证RSI,以及它何时可能实现等问题,我们整理了来自姚顺宇、施天麟等硅谷研究员,以及来自清华、上海交大等高校的助理教授和研究员的观点,供参考:

1. 当AI公司在扩大自身规模(如模型能力、客户规模等)时,不再需要同步扩大团队规模,RSI就会发生。

2. RSI不是一个单一事件,而是一个连续的过程。

3. 从今年年初的一些迹象来看,RSI是可以实现的。主要原因是Coding和Agent Model都已成熟,达到了一个突破点。按照Coding Agent的方式,可以让AI去训练AI,实现AI自己的想法并改进自身,包括架构、数据集及其训练方法等,从而推动RSI的实现。

4. RSI与模型在自己生成数据上的微调,很难说清两者的区别是定性还是定量的。从某种意义上说,模型自己生成数据是RSI的雏形。

5. 数据和环境是RSI落地的良好商机。

6. 与OpenAI、Anthropic等大厂竞争,创业者的机会不在于通用智能,而在于基础知识之外的专业知识。

7. 不需要从头训练RSI模型,其基础性能难以超越通用大模型,也难以通过自我迭代获得更强的能力。

8. 评估智能时,应关注它是如何学会这一能力的,而非学会了什么。

9. 验证的终极形态不应依赖人工,但在短期内,必须保留人的参与,尤其在任务定义和质量把控上,仍需人类专家提供高质量的测评。

10. RSI的最终版本可能是一个能自我改进的模型;但在当前初级阶段,可以依赖外部辅助模型和收集反馈信号。

11. 人们脑海中设想的RSI,可能是其终局——整个循环完全无需任何人。但从实际角度看,我们是否会达到那一天,以及是否有必要追求到那一步,仍不确定。

以下是这场由AGI House、红杉中国、Research AI+联合主办,主题为“当AI开始递归自我改进”活动的部分干货内容,经摘编整理:

在此之前,先介绍一下几位嘉宾——

  • 姚顺宇:Google DeepMind主任资深科学家,专注于Auto-Research方向探索,博士毕业于斯坦福大学理论物理专业,此前曾在Anthropic任职。
  • 施天麟:Recursive Superintelligence联合创始人,清华姚班校友,曾在OpenAI担任研究员,在斯坦福大学读博期间退学并联合创办了AI公司Cresta。
  • 谷雨:NeoCognition联合创始人,ApprenticeBench第一作者。
  • 周煊赫:上海交通大学助理教授,Theseus Labs创始人。
  • 孟繁青:Evolvent AI联合创始人,RSI Bench Data第一作者。
  • 刘子鸣:清华大学助理教授,元环智能创始人,专注于AI for AI方向。
  • 穆尧:上海交通大学助理教授,SeeAct AI创始人,从事具身智能的RSI方向。

此外,其他嘉宾还包括来自海内外其他高校和实验室的研究员、博士生。值得一提的是,主办方AGI House活跃于硅谷,是一个AI创业社区与孵化器,这也是他们首次在中国国内举办活动。

那么,进入正题。

如何递归?如何改进?

Q:如何定义RSI?

姚顺宇:RSI可能不是一个事件,而是一个连续的过程。我们现在只能讨论的是,我们在这个连续过程中所处的位置。

举个例子,模型从几年前就能自己编写代码了,它能写代码这件事实际上也加速了研究闭环,这也可以看作是RSI的一部分;后来模型能主动监控实验进程并提出新实验,这同样可以算作RSI。

从效果上看,人们脑海中设想的RSI,可能是其终局——整个循环完全无需任何人。但我们是否会达到那一天,以及是否有必要追求到那一步,仍不确定。

施天麟:从RSI的角度看,模型本身必须能觉察到自身的约束情况。它需要知道自己在哪些方面存在不足,并在明确出现偏离时,能自行纠正。这是RSI本身和模型自我强化的重要能力。

当然,仅靠模型本身是不够的,还需要通过一定的工具和应用场景来约束模型。

谷雨:RSI是一个很大的课题,我们今天在场的几个人,可能做的事情都完全不同。

大家的共性,可能包括以下三个类别:一是AI自行找到提升目标;二是AI不断让自己更接近这个目标,这可能是迭代过程;三是这个目标背后可能对应着长期任务。例如,让大模型去设计大模型,其目标可能就是更好的模型,其中AI需要自行制定预算、规划模型、总结方法,最终得到一个更新的模型。

孟繁青:我们现在经常把自我改进、持续学习和RSI这几个词放在一起讨论。

从我的角度看,RSI是指在给定环境、奖励或奖励函数的情况下,模型在其中持续迭代某个东西。这个东西可以是多种多样的,比如架构或权重,其最终目标是在该环境中获得更高的奖励得分。

在真正意义上的RSI中,模型需要优化自身、提升自身表现,而不是优化某个产物或另一个模型。整个系统除了自身、环境和奖励之外,没有其他外部因素。

周煊赫:从计算机的角度看,“递归”这个词应该递归到最本质的层面。对于一个AI系统来说,最本质的层面是它的参数和架构设计;再往外一层,是工具中的各种代码和脚本;再往外,是它交互的环境,包括各种文件和工作区。

我们对RSI的定义,是首先将其切入产业场景,观察当前工作流是否存在痛点以及痛点在哪里。发现痛点后,下一步是检索解决方案。

RSI的最终版本可能是一个能自我改进的模型;但在当前初级阶段,可以依赖外部辅助模型和收集反馈信号。

RSI真的实现自我进化了吗?

Q:如何评估RSI是否真正实现了自我改进?在场的各位也有一些关于基准测试的工作,请分享一下你们在评估方面的做法。

谷雨:评估主要关注什么,以及为什么在这个时间点比较重要,有两个关注点:

一是生态效度,在基准测试上表现良好,并不一定意味着它能真正解决问题,或直接对应实际的生产或经济价值。我们想验证的是,让一个通用大模型变成能在某个岗位上有效执行的成熟员工。因此,我们需要搭建一个贴近真实工作的环境。

二是,我们到底要评估智能的什么?我在很多场合引用过一个观点:智能不是指你知道多少东西,而是你如何学会这些东西的。

周煊赫:评估非常重要,尤其是华人做AI,在确定一个方向后,大家很快会把这个方向的天花板卷起来。

当前的问题是,基准测试本身不够好,即使一些知名基准测试也存在许多错误。面向RSI的基准测试应该是什么样的?除了传统Agent的推理、探索和规划这三种能力外,我们还需要思考RSI需要哪些新能力。我们也相信,未来不仅需要AI自行迭代,真正高质量的基准测试仍需结合人类专家。

验证,是RSI持续演进的卡点

Q:如何定义验证,或者可以分享一些你们的思考?

姚顺宇:关于RSI最难实现的是自我改进,还是证明自己确实改进了?我认为是验证自己确实改进了。

过去很多人做过类似的事情,当时叫“赛博批评”——即一个AI出题、一个AI解题。这种做法最容易陷入局部最优:比如一个AI总是出非常简单的题,另一个都能答对;或者一个AI总是出非常难的题,另一个永远答不对。因此,最困难的地方在于,模型必须能真正理解自己到底进步了多少。与解决问题相比,RSI中最难的肯定是定义问题。

孟繁青:先不谈验证本身设计得是否合理,即使它完全正确,也会带来一个很大的问题:可复现性。

当前环境越来越复杂,涉及CPU型号、操作系统是Mac还是Windows、内存大小等,不同物理平台会导致差异存在。

此外,大多数基准测试都针对每个问题给出一个0到1的绝对分数。但这些分数实际上并没有很强的物理意义,绝对分数本身也说明不了什么。

我们公司的一位合作者提出了另一套评分标准。它将层级分为Agent-SOTA、Human-SOTA等不同层级,每一层对应不同的产物。在每个新平台上,通过运行这些产物来确定模型的输出属于哪一层。这可以避免上述物理意义和硬件差异导致的问题。

周煊赫:我很早之前看过清华一个团队的工作,他们在推理过程中通过给权重添加扰动噪声,验证不同的扰动方式,可以让模型推理得更好。这实际上实现了我们追求的目标:边推理、边学习、边调整权重的能力。

从内部看,我们现在已经设计了推理和记忆分离的模块,从记忆埋点模块有一些隐式的中间态传递,也可以通过外部手段进行保护。

与大厂争夺生态位的RSI初创公司

Q:如何思考RSI创业公司与模型厂商之间的边界?哪些方面模型厂商具有绝对优势,哪些方面创业公司能做出差异化?

孟繁青:RSI的概念很大,科研机构、创业公司和大厂,每个人做的实际上都是其中不同的部分,从上到下是这样的:

最上游,像Alphabet、OpenAI或Kimi这类公司,他们所说的RSI基本上是纯粹的RSI,即模型迭代自身,包括整个架构,追求更高的智能。

再往下一层,比如一些传统SaaS公司,RSI需要环境和验证。对他们来说,能否将自身原有的生态抽象出一套面向Agent的服务,方便上游模型厂商通过Agent调用,并提升Agent在该场景下的智力,这可能是这些下游传统公司理解的RSI。

再往下,一些初创公司的方向可能是:不纯粹用RSI迭代基础模型本身,不花大价钱训练自己的基础模型,而是用RSI迭代某些产物,如工具。

对于上游和初创公司,目标比较明确:要么提升模型本身,要么提升下游表现;而对于底层的SaaS公司,他们对RSI的态度可能是,能否在其中提供更多环境。

周煊赫:尽管对数据的要求越来越高,但我认为,当前的数据和环境仍然是一门好生意。

在一艘到处漏水的船上,靠用手堵窟窿解决问题。大厂的手再多,也顾不过来。因此,当模型落地到各行各业时,需要一套自进化的范式,这个范式的核心两个要素是数据和环境。

在数据方面,对于预算不足的小公司而言,他们需要一套轻量化的数据方案,再将其转化为用户自己的资产。

在环境方面,在嘈杂环境中执行任务,即使是最好的Agent,任务执行效果也会大幅下降。如何很好地理解并将这套方案与模型协同进化的范式,非常重要。

谷雨:我觉得可以从两个角度来看:第一个角度是创业公司服务模型厂,第二个角度是创业公司做的事情与模型厂互补。

关于服务模型厂,比如刚才周老师提到的卖数据、卖环境,这都是很好的生意。

关于与模型厂互补,刚才繁青老师也提到,模型厂提供的是通用智力,即模型的通用能力。我认为我们或大多数出来创业的人,不应该与大厂比拼通用智能,而应该做通用智力之后的专门知识。

一些争议

Q:目前行业内关于RSI的讨论,哪些观点和定义是你们不认可或不理解的?

谷雨:我不太理解为什么国内的投资人给RSI投了这么多钱?

刘子鸣:自进化是一个非常悲观的未来。

上一次自进化是从灵长类动物进化到人类,这是一个相当漫长的过程。尽管现在AI看起来取得了大量进展,但我认为自进化是一条低效的路线,意味着我们被卡在低维。

打个比方,现在的大模型是一个银河系,我们在银河系内,所以觉得银河系就是全部。但如果顺着大模型的路径慢慢向外拓展,你会发现大模型外面其实是虚空。只有先熵增,上升到宇宙的维度,然后再做熵减,才能发现,可能别的地方还有一片星系适合人类居住。

分久必合,合久必分。我们现在正处于合的阶段,只需要设计一个模型就能解决所有问题,但它的边界也在逐渐暴露出来,现在我们需要为不同领域设计不同的模型。

孟繁青:有些人在做RSI模型,我不太理解这个词。

比如某个模型可以完成一些垂直领域任务,这只是单纯将RSI概念包装到垂直模型上;又比如强调做模型的方法是RSI,这也不是真正的RSI,因为当前模型厂的后训练已经实现了高度自动化,这里的RSI能力在训练时已被模型厂商内化了。

假设我们常规训练出一个模型,它在环境中反复迭代、不断提高奖励反馈,学习曲线上会呈现出“得分随训练时间推移上升”的斜率。RSI模型的价值在于,这个斜率会更高。这个模型不应该是针对某个垂直领域调出来的,而是具有通用性的。

周煊赫:关于做RSI的预训练模型,我非常不相信。

我们相信RSI路径有两种:一种是大厂正在做的,堆算力、自己找数据、构建超大规模图谱、出难题训练自己;另一种是,当AI进入各行各业时,由于大厂也缺乏这些环境的数据,因此通用模型在这类场景的解决能力也比较有限,我们相信还需要另一套RSI范式。

下一个突破

Q:你最期待的RSI范式突破是什么?或者说,你认为未来什么样的潜在范式突破会对你们正在做的事情造成颠覆?

孟繁青:我比较期待看到RSI如何改进基础设施层。基础设施原本是为人类使用者设计的,之后会不会衍生出一些更面向Agent的方法?比如原本的SaaS,它们现在已经在积极改进和提升自身能力;但更底层的东西,比如各种训练基础设施,之后会不会出现一些纯智能类的Agent去介入?

谷雨:我关注的是实验学习的能力,尤其是在真实环境中的实验学习。我们公司现在真正在做的是:将一个Agent放入一家真实公司后,如何让它自己去摸清这家公司的规则和工作流程。

我们公司目前比较押注的一条路线,是对比非参数化和参数化这两种形式。

非参数化路线,就是现在很多人在做的上下文和记忆路线,其好处是不需要调整模型权重,也不需要大量样本;坏处是不够鲁棒,因为更新记忆文档的优化算法并不稳定,其压缩能力和表达能力也不够强。而参数化路线,表达力非常高、压缩率很高,但需要大量训练样本。

因此,我们认为一个可能的未来方向是:通过非参数形式,在线过程中学到一些新知识,再让基座模型生成更多数据,或将这些知识压缩进参数中。

周煊赫:我们相信,RSI会内化在模型本身的能力上。此前提到的与生态环境不匹配的问题,本质上是模型能力不够强。如果未来模型能力提升,可能自己就会将RSI跑闭环。具体来看,它需要以下几方面能力:

第一,主动感知环境的能力。模型能主动、流式、低成本地将环境中各种模态的数据输入进来,感知哪些与任务对齐,并进行模态消歧。进一步,它甚至可以做到改造环境、适应环境。

第二,探索和创新的能力。它不应该被限制在人类的偏好对齐上,而是能自主探索出领导力、品味等能力,甚至关键信息的感知能力。

第三,在线持续学习的能力。一定不能只有后训练

更多文章