球友会

最新动态

在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境

大模型过去几年的能力跃迁,几乎都围绕一个词: Scaling 。 模型越来越强,Agent 也开始从 “会聊天” 走向 “能干活”。 但模型部署之后呢? 一个 Agent 真正进入从没见过的软件、工具或者企业系统时,问题往往才刚刚开始。新的软件有新的交互逻辑,新的工具有新的调用方式,不同环境还有各自隐藏的约束、异常状态和失败模式。 即便底层模型已经足够聪明,它也未必真正理解这个环境里的 因果结构 :什么操作会带来什么结果?哪些条件会触发失败?改变哪些关键因素,才能真正把任务做成? 过去最直接的办法,是遇到一个新环境,就再收集一批交互数据,通过微调、强化学习或者人工反馈重新训练。 但这条路很难无限走下去。一方面,数据采集、标注和训练本身都要付出成本;另一方面,在企业内部软件、私人工作环境和不断变化的数字系统里,很多数据既不能公开,也不适合每换一个环境就重新训练一遍。 于是问题变成了: 如果不更新模型参数,一个 Agent 能不能像人一样,通过自己探索新环境、发现其中的因果规律、总结经验,并持续提升自己的能力? 最近, 专注于因果智能的 Aether AI 提出了 RSIAgent 。通过 RSIAgent,他们想试另一种 Scaling: 不继续 Scale Model,而是 Scale Experience 。 也就是说,模型参数先不动,让 Agent 自己进入环境探索、试错、验证,再把得到的经验不断积累下来。 RSIAgent 给出的方案,是一套面向数字智能体的 Autonomous Exploration for Recursive Self-Improvement(RSI,递归自我提升)框架 : 让 Agent 自己决定学什么、自己进入环境获取经验、自己验证结果,并将其中稳定的动作 — 条件 — 结果因果关系沉淀进 Memory,供后续任务直接复用 。 这个思路延续了 Aether AI 团队一直在追问的问题:AI 能不能不只记住 “什么通常有效”,而是真正理解 “什么改变会导致什么结果”。 更值得注意的是,这种 “靠经验继续变强” 的路线,已经在实验里表现出了相当直接的效果。 在不更新模型参数的情况下,RSIAgent 能够持续提升 Kimi-K3 和 GLM-5.3 等开源模型的 Agent 能力,并在 OSWorld 2.0 与 Agents’ Last Exam 上超过 GPT-6 Astra 等闭源模型。 其中,RSIAgent 在 OSWorld 2.0(0808 offline)上取得 78.98% 的 Partial Score,在 Agents’ Last Exam(Near-term)上达到 84.82% ,大幅领先于 GPT-6 Astra 的 72.60% 和 82.26%。 图 1|RSIAgent 框架与性能表现:RSIAgent 通过 “课程生成 — 执行 — 验证 — 记忆演化” 的递归闭环自主适应新环境,并使开源模型在 OSWorld 2.0 和 Agents’ Last Exam 上超过多款前沿闭源模型。 论文标题:RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments 论文链接:https://arxiv.org/pdf/2609.15364v1 代码链接:https://github.com/AetherLabsAI/RSIAgent 网站链接:https://aetherlabsai.github.io/RSIAgent/ 从 “被动学习” 到 “主动探索”:RSIAgent 的核心思路 RSIAgent 的核心,是把 Agent 与新环境的交互过程本身变成一种持续学习过程。系统围绕一个不断演化的 Memory,构建由 curriculum agent、actor agent 和 verifier agent 组成的多智能体递归闭环:curriculum agent 决定下一步应该探索什么,actor agent 进入环境执行任务并积累经验,verifier agent 根据真实环境反馈判断结果是否可靠,最终将有效知识持续写入 Memory。这样,Agent 不再只是被动完成任务,而是能够自主选择学习方向、获取经验并不断扩展自己的环境知识。 在此基础上,RSIAgent 进一步采用 Broad-to-Deep 的两阶段自探索策略,其思路类似于大模型训练中的 Pre-training → Post-training :先通过广泛探索建立整体能力覆盖,再围绕关键难点进行针对性强化。 第一阶段:Broad Recursive Self-exploration 这一阶段类似于

about image