MoreRSS

site icon机器之心修改

中文人工智能垂直媒体。由kindle4rss生成。
请复制 RSS 到你的阅读器,或快速订阅到 :

Inoreader Feedly Follow Feedbin Local Reader

机器之心的 RSS 预览

突发!陶哲轩、邓煜等25位菲尔兹奖得主联合声明:AI公司正在摧毁数学

2026-09-12 06:54:00

编辑|Panda

9 月 11 日,陶哲轩、邓煜等 25 位菲尔兹奖得主联合署名发表了一份公开信《人工智能在数学中的严重错位(A Severe Misalignment of AI in Mathematics)》。陶哲轩把全文贴在了自己的博客「What's new」上,另有专门页面 mathandai.org 承载并开放继续联署。



地址:https://terrytao.wordpress.com/2026/09/11/a-severe-misalignment-of-ai-in-mathematics/


公开信第一段内容就解释了原因:「过去几个月,大语言模型的数学能力急剧提升,已经能解决多个数学领域中重大的未决问题;但 AI 公司把解决数学问题当作基准测试来推进的做法,对数学这门科学、对数学共同体都是有害的AI 公司的目标与数学共同体的目标严重错位。我们认为,这属于更广泛的错位问题的一部分,影响着其他科学与创意职业,乃至整个社会。」


这倒不是一封反对 AI 做数学的信。声明后文明确承认 AI 有加速真正数学研究的潜力。


它反对的是公布方式:匆忙宣布、来不及写出像样的论文、来不及提炼新方法、也来不及引用他人在先的工作。在数学界看来,这套流程正是数学之所以能被传承下去的重要依托。


值得一提的是,声明选用的核心词 misalignment(错位/对齐失败)原本是 AI 安全圈的术语。这两天,AI 公司的自己人也经常说到这个词。比如,就在今天,刚离开 Anthropic 安全团队、即将加入独立评估机构 METR 的 Joe Benton 在 𝕏 上写道,AI 公司正竞相打造比任何人类都聪明得多的机器,而我们可能无法在这场竞赛中幸存。



而三天前辞职的 Jacob Coxon 措辞更硬,称他待过的两家公司 OpenAI 和 Anthropic 都没有负责任地行事。其推文引发广泛关注,已有超过 1.66 亿次浏览。



这些警告都指向了同一个判断:AI 推进的方式似乎和它本该服务的目标之间出现了偏差(misalignment)


一份没有时间打磨的公开信


这份公开信签名名单横跨 48 年的菲尔兹奖史,从 1978 年的皮埃尔·德利涅(Pierre Deligne)一直排到 2026 年的邓煜(Yu Deng)。中间是彼得·舒尔茨(Peter Scholze)、玛丽娜·维亚佐夫斯卡(Maryna Viazovska)、许埈珥(June Huh)、詹姆斯·梅纳德(James Maynard)、马克西姆·孔采维奇(Maxim Kontsevich)、曼朱尔·巴尔加瓦(Manjul Bhargava)、森重文(Shigefumi Mori)、吴宝珠(Ngô Bảo Châu)这样的名字——基本可以理解为在世菲尔兹奖得主中相当大的一部分。



正如前文截图所示,陶哲轩在个人博客里补了一些说明:这份声明由 25 人在过去一周的讨论中形成,遗憾的是没有时间像 Leiden 宣言那样走一个更具协商性的流程,但他们认为情况的紧迫程度要求尽快发声。


其中的论证链条并不长。数学处理的是形状、数字和自然现象的基本结构,几代人积累下一整套精巧的思想、方法与抽象工具;著名问题之所以重要,是因为它们是丈量这片地貌的地标和灯塔,解决其中一个,向来意味着新洞见和新方法的出现,接下来会经过报告、讨论、简化的漫长过程被共同体吸收,理想状态下最终变成研究生甚至本科生能读懂的教科书内容。有些思想还会在几十年甚至几百年后,变成全人类都在使用的工具。


问题在于,解题只是达成理解与洞见这一首要目标的工具和代理指标。声明写道,在 AI 的语境下忘记这一点,可能让工具反过来伤害目标:以越来越快的节奏批量生产「真/假」判断,会摧毁孕育新思想的土壤。


这些 AI 解答常常在匆忙中被公布,来不及写出像样的论文,来不及提炼出新方法和新思想,也来不及引用他人相关的在先工作。声明说,和所有创造性行业一样,这引出了严重的归属与剽窃问题;而如果没有愿意接手的数学家去发展这些思想、把它们整合进数学的正典,AI 构想出的想法永远不会真正活起来,数学家之间那条关键的人类传承链会就此断掉


导火索:88 小时、1 万个智能体、一场署名争执


要理解这封信为什么此刻出现,需要回到三天前。


9 月 8 日上午,纽约大学数学教授 Tristan Buckmaster 公布了三项证明,涉及欧拉方程等系统在光滑外力作用下的有限时间奇点,合作者是 Anthropic 的数学家 Levent Alpöge。两人主要使用 Codex,也用了 Claude。这本身是硬成果,但 Buckmaster 在声明 PDF 里写了一句:这个故事还有另一部分,而说实话,他非常希望自己不必去操心这一部分。



几小时后,OpenAI 发布了 Navier-Stokes 存在性与光滑性问题的完整证明。



这是克雷数学研究所(Clay Mathematics Institute)七个千禧年大奖难题之一,每题悬赏 100 万美元,此前只被解决过一个。


OpenAI 称,证明由一个未发布的下一代内部模型完成,约 1 万个智能体并行工作 88 小时(9 月 1 日至 5 日),发送了 270 万条消息,消耗约 1300 亿输出 token,结果在 Lean 中完成了形式化验证,并同时公开了一份 166 页的证明文稿。刚发布不久的 GPT-6 Astra 在这个流程里只负责核对答案。


技术上的争议随即出现:OpenAI 的构造带有一个施加于流体的光滑外力项(forcing term),而克雷研究所的标准表述针对的是无外力情形。OpenAI 自己的说法是这「确立了千禧年大奖问题官方表述中的陈述 C(以及 D)」,但公司明确表示不申领这 100 万美元奖金。


但真正点燃数学圈的不是技术边界,是时间线。


据 Buckmaster 的公开声明,在他和 Alpöge 收尾自己工作的过程中,他们得知关于其进展的信息已经传到了 OpenAI。联系对方后,他们被告知 OpenAI 已经拿到了完整证明;但当他们追问 OpenAI 何时开始研究这个问题、其中有多少人类输入时,回答变得闪烁。最终确认的是,第一条 prompt 发出的时间就在最近几天,也就是在他们的工作信息到达 OpenAI 之后。


Buckmaster 的怀疑集中在路径选择上。他说,通过光滑外力通往克雷问题的这条路(c 和 d)是他和 Alpöge 悄悄选定要攻的方向,据他所知几乎没有别人在做,这不是把题目丢给模型几天就能走到的方向。


争执还牵扯到署名。Buckmaster 声称,OpenAI 的数学家 Sébastien Bubeck 曾提出一个折中方案,要求他撤掉 Alpöge 的署名,因为 Alpöge 受雇于 Anthropic。当 Buckmaster 坚持把争议公开时,据他转述,Bubeck 回了一句「你为什么要毁掉自己的职业生涯?」,随后又说如果对方不希望他好好说话,他也可以不好好说话。


OpenAI 的官方页面给出了不同版本:其行动始于 9 月 1 日,起因是听到了两个千禧年难题被解决的传闻;在 9 月 6 日完成 Lean 验证后,因为以为对方也拿到了 Navier-Stokes 的解,主动联系希望联合发布并承认对方的优先权;沟通中向对方开放了全部 prompt 和证明。关于训练数据,OpenAI 表示研究者和智能体在对方公开前没有通过任何途径看到其工作,没有为解决此问题调取任何特定用户数据,但补充说虽然可能性不大,无法排除源自其产品使用的去标识化数据曾帮助改进模型;同时强调两份证明差异显著,在欧拉情形下所证的精确结果甚至不同(有外力与无外力)。



9 月 10 日,在加州理工学院研究者的批评之后,OpenAI 撤回了对该校一场数学活动的赞助。



一天后,25 位菲尔兹奖得主的联合声明发布。


2026 年,数学界被推到台前的一年


把时间轴拉长,这封信可以说是「AI+数学」方向一条压力曲线的顶点。


今年 5 月,OpenAI 的内部模型给出了 Erdős 单位距离猜想的反例,推翻了这个在组合几何中悬置约 80 年的猜想,结果被广泛认为达到数学顶刊的发表水准。值得注意的是,联名撰写配套论文的九位数学家里,就有后来的 2026 年菲尔兹奖得主。


6 月 2 日,16 位来自 15 所大学的数学家发布《关于人工智能与数学的莱顿宣言》(Leiden Declaration),源头是 2025 年 9 月莱顿大学 Lorentz 中心一场汇集十国约六十名研究者的研讨会,此后由工作组打磨八个月成稿。宣言首日 130 人签名,24 小时内突破 1000 人,国际数学联盟(IMU)正式背书,彼得·舒尔茨(Peter Scholze)等人署名。它反对有三:未经同意把论文当训练数据绕过同行评审直接向媒体发布结果、以及不对结果所依赖的先前工作作出归属说明



地址:https://leidendeclaration.ai/#declaration


7 月,Alpöge 用 Claude Fable 5 找到了雅可比猜想(Jacobian conjecture)的反例,推翻了这个存在 87 年的猜想。陶哲轩随后在博客上专门写了一篇对该反例的消化解读。


7 月 23 日,国际数学家大会在费城开幕,2026 年菲尔兹奖授予邓煜、王虹、John Pardon 和 Jacob Tsimerman。邓煜与王虹是继 1982 年丘成桐之后的华人得主,王虹也是该奖 90 年历史上的第三位女性得主。邓煜是这次 25 人联署名单中最年轻的一位。



而 Tsimerman 在领奖后宣布,他将从多伦多大学停薪留职,于 8 月加入 OpenAI 从事 AI 安全研究。他给出的判断是:世界正在改变,我们所知的那种数学家职业生涯,他认为不会以现在的形式继续存在。他的逻辑是数学家应该进到实验室里去,为这些系统提供它们目前缺乏的形式化保证,而不是在场外旁观。Tsimerman 不在这 25 人名单上。


9 月 8 日,Navier-Stokes。9 月 11 日,公开信。


结语


这封公开信的诉求其实是关于流程的三件事:给写作与思想提炼留出时间、明确标注结果所依赖的先前工作、承认需要有人类数学家愿意接手消化。这三条与莱顿宣言方向一致,只是签名的分量不同。它同样没有强制力:AI 公司没有义务放慢发布节奏,也没有义务接受共同体的审查。25 位菲尔兹奖得主齐声说话所创造的是一个参照点,政策制定者、期刊编辑和资助机构在处理 AI 生成的数学主张时,可以指向它。


陶哲轩是这批签名者里立场最微妙的一个。他长期是 AI 辅助数学最认真的实践者,用 ChatGPT 配合 Lean 做形式化,也公开描述过模型绕圈、引错定理、需要人盯着的具体情形。评论 Navier-Stokes 结果时,他用了一个向导带路的比方:找到一条通往瀑布的路径是有价值的,但一旦有人指出了这条具体路径,人们就只会走这条路。数学界担心的并非 AI 解不出题,而是解出题之后,那些原本会因为「解出来了」而被生产出来的东西没有人再去生产,包括方法的提炼、思想的传播、教科书、下一代。


此外,AI 抢先证明还可能危及数学研究的放文化。TechCrunch 报道称已有数学家开始怀疑自己使用 Codex 的记录是否已经被喂给了模型;如果前沿 AI 实验室在看到一条有希望的路径后,能用上千万美元算力抢在原始研究者之前完成证明,开放研究的文化就会被系统性地推向保密。


Keras 作者、ARC Prize 联合创始人 François Chollet 还补了一个更难量化的士气:他说自己在数学学生中听到一种非常普遍的情绪——「我不想再当数学家了」;AI 或许不会在功能上取代数学家,但完全可能通过压垮年轻一代的心气,造成事实上的近乎灭绝。



这个问题,或许需要我们整个社会一起回答,正如这份公开信最后一段写的那样:「这些问题必须被紧急处理——在数学共同体内部,在开发这些技术的公司那里,以及更广泛地,在一个将以许多其他形式遭遇同样问题的社会之中。数学是第一个被逼到台前、必须把自己的价值观明确写下来的学科。它不会是最后一个。」


以下为公开信全文(中文版):


AI 在数学中的严重错位



地址:https://mathandai.org/


过去几个月,大语言模型的数学能力急剧提升,以至于它们能够解决许多数学领域中重大的未决问题。然而,AI 公司把解决数学问题当作基准测试来推进的做法,对数学这门科学、也对数学共同体是有害的。AI 公司的目标与数学共同体的目标严重错位。我们认为这属于更广泛的对齐问题的一部分,这些问题正在影响其他科学与创造性行业,乃至整个社会。


研究数学所处理的,是形状、数字与自然现象的基本结构。在一代又一代人的努力中,它建立起了一整套庞大的、精巧的思想、方法、抽象与其他工具,用以理解数学的地貌。反过来,现代技术与科学也建立在数学工具之上。


著名问题常常扮演地标与灯塔的角色,人们以它们为尺度,衡量自己对这片地貌的理解是否有所推进。解决其中一个问题,向来是新洞见与有趣方法出现的确切标志,而这些洞见与方法随后会被整个数学共同体研究——通过报告、讨论、简化这一漫长而艰苦的过程。在这个过程的终点,理想情况下,人们会得到一份适合任何研究生、甚至本科生学习的教科书式表述。有些数学思想的旅程还会走得更远,在几十年甚至几个世纪之后,成为被全体民众理解和使用的工具。


数学共同体在许多方面都像一个人类社会的微缩版本。它由使用各种不同方法的个体组成,因共同的核心价值观而结合在一起。我们这个行业最珍贵的资源是学生和思想,我们以极大的用心呵护它们。我们感到有责任让它们成长到充分的潜力,直到它们能够在数学世界中拥有自己的生命。对于学生,我们布置问题时的核心意图往往是培养技能,使他们能够在研究以及其他领域取得进展。对于我们的思想,我们通过报告、私下讨论和精心的写作来传播,并把它们与他人在先的思想联系起来。这些过程无一例外都需要时间,并且建立在人与人的互动之上。


最近几个月,AI 在解决重大数学问题上的成功,甚至在数学圈之外也登上了头条。但解决问题只是一种工具,是通向首要目标——概念性的理解与洞见——的代理指标。在 AI 的世界里忘记这一点,可能会使工具反过来对抗首要目标。事实上,以越来越快的节奏大规模生产「真/假」陈述,可能摧毁孕育新思想的沃土,而不是为它注入生命。


这些解答常常在匆忙中被公布,没有留出时间写出像样的论文、提炼出新的方法与思想、并引用他人相关的在先工作。正如在所有创造性行业中一样,这引出了严重的归属与剽窃问题。此外,如果没有愿意承担责任的数学家去发展这些思想、并将其整合进数学的正典,AI 构想出的想法将永远无法真正活起来,数学家之间那条至关重要的人类传承链条也会就此失落。


我们正在目睹一种对智力工作的普遍威胁:AI 使用的结果与其最初目的之间出现了错位。在许多领域与活动中,多年的训练传统上不仅是为了产出一个最终答案或产品,也是为了发展理解力,以及提出新问题和新思想的能力。然而,在庞大的人类既有工作的基础上,AI 系统正变得越来越有能力直接产出这类工作的结果,于是这些目标不再一致。数学共同体当下面临的问题,与其他科学和创造性行业正在面临的问题相似,并且预示着全人类可能面临的问题:当 AI 改变工作的方式时,我们如何确保自己不会忘记这项工作最初是为了什么。


AI 提供了增强并加速真正的数学研究与理解的潜力。作为一个行业,数学需要在若干方面适应这些变化。然而,这些变化最终是让这个领域受益,还是产生破坏性的效果,将在很大程度上取决于掌控这项新技术的人所做的决定。


这些问题必须被紧急处理:在数学共同体内部,在开发这些技术的公司那里,以及更广泛地,在一个将以许多其他形式遭遇同类问题的社会之中。


阿图尔·阿维拉(Artur Avila,2014 年菲尔兹奖)

曼朱尔·巴尔加瓦(Manjul Bhargava,2014)

考切尔·比尔卡尔(Caucher Birkar,2018)

皮埃尔·德利涅(Pierre Deligne,1978)

邓煜(Yu Deng,2026)

西蒙·唐纳森(Simon Donaldson,1986)

雨果·杜米尼-科潘(Hugo Duminil-Copin,2022)

阿莱西奥·菲加利(Alessio Figalli,2018)

马丁·海雷尔(Martin Hairer,2014)

许埈珥(June Huh,2022)

马克西姆·孔采维奇(Maxim Kontsevich,1998)

埃隆·林登施特劳斯(Elon Lindenstrauss,2010)

皮埃尔-路易·利翁斯(Pierre-Louis Lions,1994)

詹姆斯·梅纳德(James Maynard,2022)

柯蒂斯·麦克马伦(Curt McMullen,1998)

森重文(Shigefumi Mori,1990)

吴宝珠(Ngô Bảo Châu,2010)

安德烈·奥昆科夫(Andrei Okounkov,2006)

彼得·舒尔茨(Peter Scholze,2018)

斯坦尼斯拉夫·斯米尔诺夫(Stanislav Smirnov,2010)

陶哲轩(Terence Tao,2006)

玛丽娜·维亚佐夫斯卡(Maryna Viazovska,2022)

塞德里克·维拉尼(Cédric Villani,2010)

文德林·维尔纳(Wendelin Werner,2006)

叶菲姆·泽尔马诺夫(Efim Zelmanov,1994)


图片


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]


破局单模型局限!清华大学李秀教授团队提出EMERGE-Policy:以多智能体协作迈向「具身智能系统」时代

2026-09-12 06:54:00


在长期的机器人操作 (Robot Manipulation) 的研究中,单模型 (如视觉语言动作模型,Vision-Language-Action, VLA) 被广泛研究。然而,单一种类模型难以应对复杂的长程任务与突发干扰。



为此,清华大学深圳国际研究生院智能计算实验室硕士生方智睿,于清池,陈子扬等在李秀教授的指导下,联合多家高校推出了全新的多智能体异步并发框架 ——EMERGE-Policy。它打破了过去各项技术割裂研究的局面,将 VLA、WAM、世界模型、验证器等不同架构和用途的模型整合为系统可调用的「多元工具集」。


该框架打破了「单一 Policy 决定一切」的传统范式,通过主智能体 (Main Agent)、角色化子智能体 (Sub Agents) 与统一技能库 (Skill Library) 的闭环协作,向具身智能领域做出「我们需要怎样的具身智能系统架构?」的回答。



  • 论文标题:EMERGE-Policy: A Rob ot Mind Emerges Beyond a Single Policy

  • 论文地址:https://arxiv.org/abs/2608.29896v2

  • Website: https://emerge-policy.github.io/EMERGE-Policy/

  • Code: https://github.com/EMERGE-Policy/EMERGE-Policy

  • 清华智能计算实验室官网:https://thusigsiclab.github.io/thu.github.io/


破局「分而治之」:从单一模型到多模型集成具身智能系统


Annie Murphy Paul 在《延展的意识》中写道:「在大脑之外思考,意味着巧妙地借助头脑之外的实体。」(「Thinking outside the brain means skillfully engaging entities external to our heads。」)


在以往的具身智能研究中,大家往往追求用单个「端到端模型」解决问题。然而,单模型在面对复杂的长程任务时,频繁的低级感知数据处理,高层规划器的上下文思考和细粒度的动作输出等任务往往不能很好的兼容,导致逻辑混乱或累计误差崩塌。 


EMERGE-Policy 提出了全新的「具身智能系统」范式:智能不应拘泥于某一个模型,而是通过图结构 Agent 的编排异步并发的处理任务,将各类专项模型作为「工具」统一调度,让系统级智能在多组件的协同互动中「涌现」(Emerge)出来。


这样的系统架构和人类发挥智能的方式不谋而合:人在与环境进行交互的过程中通过视觉模块(眼睛)感知环境,通过双手执行操作「技能」,通过大脑进行想象…… 不同异构的器官执行不同种类的技能。


基于 VLA、WAM、世界模型与验证器等模型的异构工具库


EMERGE-Policy 的核心突破在于其统一技能库(Unified Skill Library)的设计。它不再把各种主流操作模型视为相互竞争的替代方案,而是将它们全部封装为标准化的工具接口,融合进同一个具身智能系统中(见图 1):


图 1:EMERGE-Policy 系统及其协调组件的总体架构


按图 1 所示,Emerge-policy 将技能分为 3 类:


  • 操作技能(Operational Skills):VLA, motion planner 与 WAM. VLA(Vision-Language-Action)模型:作为低级视觉 - 语言 - 动作映射工具,专注于高频、精确的机器人末端轨迹与物理控制生成(EMERGE-Policy 中采用 pi_{0.5})。运动原语:在众多操作任务当中,作为宽域动作或宏观动作生成工具,在粗粒度或大范围运动规划时快速响应。

  • 想象与预测技能(Imagination Skills):世界模型(World Model)将世界模型(WM)(如 Cosmos Policy 等)引入工具链。系统在真正执行动作前,可调用世界模型作为「仿真器」,预测未来可能生成的视频状态,实现「想好了再做」。

  • 评估与校验技能(Evaluation & Verification Skills):验证器(Verifier Model)集成评价与验证器模型,在动作执行前校验前提条件(Preconditions),在动作执行后校验目标完成度(Completion Criteria),在预演阶段为世界模型预测的多种候选路径进行打分筛选。


结合了想象技能以及评估技能的动作使得操作过程能考虑 “后验” 得更好完成任务,其工作机制如图 2.


图 2:带想象力和评估技能的动作选择与不带想象力的评估


系统级架构:精细分工的图结构调度


在大模型 agent 工程范式变革历史中,从 prompt engineering 到 harness engineering 再到 loop engineering,AI agent 开始设计多个过程(往往就是多个 loop)之间的关系 —— 谁在谁之前、谁能并行、谁的输出喂给谁。


(1) 主智能体(Main Agent):决策和调度中枢


如图 3,主智能体维持全局任务状态,将复杂的长程任务拆解为子目标(Subgoals)。通过分层上下文工程(Hierarchical Context Engineering),Main Agent 屏蔽掉冗余的低级感知数据,只通过结构化接口调用子 Agent 与工具库。


图 3:主代理的协调与反馈流程


(2) 角色化子智能体(Sub-Agent):独立的专职单元


子智能体运行在隔离的上下文环境中,协助处理高密度的专有数据。


  • Perception Sub-Agent:感知场景 3D 边界框与空间语义; 

  • Verification Sub-Agent:实时调用验证器工具检查目标完成度; 

  • Monitor Sub-Agent:监控执行过程中的物理异常。


(3) 三层外记忆和上下文管理机制


为保证长程任务不失忆,系统引入了三层文件级记忆(见图 4): 


  • PLAN.md:记录任务图与当前进度;

  • HISTORY.md:追加存储历史观测与工具调用摘要;

  • MEMORY.md:动态修正更新的环境事实。 


当上下文达到上限时,系统自动触发 Memory Integration 压缩历史,保证系统在超长时序下的稳定运行。


图 4:三层记忆与上下文管理


实验结果:全方位刷新 Benchmark,真机表现惊艳


EMERGE-Policy 研发团队在 LIBERO、LIBERO-Plus、LIBERO-Pro 以及 RoboDojo 四大被广泛采用的基准及真实机器人上进行了全面评估:


(1). 在 Standard LIBERO 上,得益于将 Cosmos Policy 作为世界模型技能进行轨迹想象和动作选择,EMERGE-Policy 取得了 99.2% 的平均成功率(超越底座模型 0.7%);在以 pi_{0.5} 作为执行技能的 robot policy 后,平均成功率达到了 98.8%(超越底座 2.0%)。


(2). 在面对各种光照变幻、相机位姿突变的 LIBERO-Plus 扰动测试中,EMERGE-Policy (w/ WM) 取得了 93.9% 的超高完成率,比单一 Cosmos Policy 基础底座大幅提升了 11.7%(libero 系列的实验结果可见图 5)


图 5:Libero, LIBERO-Plus, Robodojo 和真机实验的不同维度的效果对比


(3) 在测试视觉记忆与长程规划的 RoboDojo-Sim 测试中,EMERGE-Policy 在 Memory 维度取得了 25.00/22.51%(score/success rate) 的优异成绩,Open 维度取得了 19.98/11.20% 的成绩,这样的指标远超同类型的其他模型(见表 1 和图 5)这表明其具备强大的历史信息编码能力和非马尔可夫推理能力,在技能重组以及开放词汇语义与动作的对齐方面表现尤为出色。


表 1:EMERGE-Policy 在五个 RoboDojo-Sim 能力维度上的结果。每项数据报告了五个能力维度的得分和成功率(%),以及它们的平均值。


(4) 真实机器人部署:多层纸杯叠放长程任务为例。EMERGE-Policy 团队在真实机械臂上部署了高难度的「多层纸杯叠放(Multi-layered Cup Stacking)」任务(见真机实验视频演示和图 6a)。机器人需要将桌面上的纸杯依次倒扣、定位并精准堆叠成 3-2-1 的三层金字塔。 



图 6:真实机器人多层纸杯叠放工作流与实验结果


高稳定度:在 100 次标准真机实验中,EMERGE-Policy 具身智能系统展现出了极高的完成度(见图 6b)。


强抗干扰:面对人为破坏(将叠好的纸杯拆毁)、纸杯尺寸变化(5%-15%)、颜色变幻及相机视角变动时,系统凭借分支栈恢复与工具库的在线重规划,依然保持了 85%-94% 的惊人成功率(见图 6c)。


结语


EMERGE-Policy 成功开辟了一条具身智能研究的新路径:我们无需强求单个模型无所不能,通过将 VLA、WAM、世界模型与验证器解耦为协同工具,以图结构的理念将多智能体系统进行统一编排,能够构建出适应力极强、高鲁棒的全栈具身智能系统。 


清华大学深圳国际研究生院智能计算实验室团队专注于模式识别,决策智能,具身智能研究方向。


未来,团队将进一步推出 EMERGE 系列工作,向具身智能领域阐述「如何做好现代具身智能系统」的团队观念!


图片


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]


从GitHub爆火到ECCV Oral,全球开发者把LingBot-Map玩出新高度

2026-09-11 14:18:00

图片
编辑|陈陈


机器人正在学习一种曾经只属于人类的能力:记住自己走过的世界。


第一次进入陌生房间时,人不会把看到的一切逐帧存储下来。我们会记住关键结构:门在哪里,桌子在哪里,刚才经过的位置,以及自己现在处于什么位置。


正是这种选择性记忆,支撑了人类在复杂环境中的持续行动。对于机器人来说,这也是走向真实世界必须解决的问题。


今年 4 月,蚂蚁灵波开源的流式 3D 重建基础模型 LingBot-Map,正是在「机器人如何记住空间」这一核心问题上,探索出了一条新的技术路线。无需复杂硬件,仅靠一颗普通 RGB 摄像头,就能让机器人在视频采集过程中,实时完成相机位姿估计与场景三维结构重建,从而填补了实时空间感知领域的关键技术空白。


在穿越多房间的长序列中,面对环境剧变与大幅视角变换,LingBot-Map 依然能表现出极强的鲁棒性


截至目前,LingBot-Map 官方 GitHub 项目已获得 16.9K Stars、1.9K Forks,并多次登上 GitHub Trending,成为 3D 视觉领域备受关注的开源项目之一。



  • 项目地址:https://github.com/Robbyant/lingbot-map

  • 论文地址:https://arxiv.org/pdf/2604.14141

  • 论文主页:https://technology.robbyant.com/lingbot-map

  • Hugging Face 链接:https://huggingface.co/robbyant/lingbot-map

  • ModelScope 链接:https://www.modelscope.cn/models/Robbyant/lingbot-map


令人惊喜的是,现在这项研究迎来新的认可。


其论文《Geometric Context Transformer for Streaming 3D Reconstruction》入选 ECCV 2026 Oral,将于会议期间进行口头报告。在昨天 ECCV 的开幕式上,机器之心前方编辑还在 Award Candidates 的名单中看到了这项工作。


从 GitHub 社区的高度关注,到顶级视觉会议的认可,LingBot-Map 完成了从开发者生态到学术界的双重验证。


更重要的是,它背后反映出一个变化:机器人空间感知的竞争,正在从看见世界,走向记住世界。


顶会认可之前,LingBot-Map 已完成开源社区验证


在入选 ECCV Oral 之前,LingBot-Map 已经在开源社区收获了一大波关注,开发者围绕这个项目进行了各种二次开发


有人快速完成复现验证,有人把它搬到不同硬件环境中尝试运行,也有开发者开始探索新的空间数据采集方式。


每个人的玩法都很有趣,这种来自社区的主动探索,往往比单纯的 Stars 数量更能说明它的生命力。


让更多人能够快速体验:从部署到可视化


对于许多研究项目,论文公开并不意味着普通开发者能够真正使用。环境配置、依赖安装、结果展示等环节,往往成为从论文 Demo 到实际体验之间的距离。


LingBot-Map 开源后不久,就有开发者制作了可在 Apple Silicon Mac 上本地运行的原生桌面前端和 3D 点云查看器,让用户能够更加直观地查看模型生成的空间重建结果。


来源:https://github.com/donalleniii/lingbot-desktop-mac


与此同时,也有开发者基于 Pinokio 制作了一键启动方案,将环境配置、依赖安装以及 Demo 运行流程进一步封装,让没有复杂配置经验的用户也能够快速体验 LingBot-Map。


来源:https://github.com/cocktailpeanut/lingbot-map.pinokio


这些尝试补齐了从研究成果到开发体验之间的重要环节,让更多用户能够真正接触和使用这一流式 3D 重建模型。


更多设备运行:消费级硬件适配


除了优化使用流程,开发者也开始尝试扩展 LingBot-Map 的硬件适用范围。


开发者 ureeey 针对 RTX 4060 8GB 显存设备进行了适配尝试,通过优化运行策略降低显存压力,让 LingBot-Map 能够运行在更轻量的 GPU 环境中。


来源:https://github.com/ureeey/lingbot-map-rtx4060-8g/blob/main/README.md?utm_source=chatgpt.com


这类尝试背后的意义在于:当模型不再局限于高配置工作站,而能够进入更多普通开发环境时,技术才有机会被更多人测试、改造和应用。


从摄像头到智能眼镜:探索新的采集入口


在 X 平台上,有开发者关注到,过去部分高精度三维扫描任务通常依赖专业 LiDAR 设备,或者需要复杂的离线优化流程,而传统方法在长时间连续输入下也容易面临稳定性挑战。


相比之下,LingBot-Map 通过普通视频流实现实时流式重建,仅需单 GPU 即可运行,达到约 20 FPS,并能够处理超过 10,000 帧的长序列输入。


来源:https://x.com/XAMTO_AI/status/2080900857235726635


在这些开发者看来,LingBot-Map 展示了一种更加轻量的空间感知路径:降低对专用硬件和复杂流程的依赖,让实时三维重建能力有机会进入机器人、AR/VR、自动驾驶等更多场景。


基于这一点,真有人进一步将 LingBot-Map 接入消费级设备。


他将 Ray-Ban Meta Gen-2 智能眼镜(无需 LiDAR)改造成 3D 扫描设备,通过手机 App 采集数据,并调用部署在 RunPod 上的 LingBot-Map 后端,在约 30 秒内完成所在空间的三维建图。即使使用较少的视频帧,室内场景仍能获得较好的重建效果。


来源:https://x.com/0x6rss/status/2079597540568137866


除了智能眼镜,这位用户在普通戴尔台式机上运行 LingBot-Map,仅对着办公桌进行一次视频采集,约 61.5 秒后便获得了一个可交互浏览的三维点云模型。


来源:https://x.com/shavonnewong_/status/2080130333094101360


而这些,只是 LingBot-Map 开源之后社区探索的一部分。对于一个 3D 视觉研究项目而言,这种持续的二次开发并不常见,这表明 LingBot-Map 已经开始进入真实的使用场景。


开源之后,团队也在持续更新评测脚本、推理优化、示例案例以及问题修复,进一步提升项目的可用性和稳定性。与此同时,官方还展示了超长视频重建结果:在约 25,000 帧、持续 13 分钟的室内行走视频中,LingBot-Map 仍能保持连续重建,生成完整的三维空间表示。


当然,社区热度只是其中一面。对于一项研究成果而言,真正决定其长期影响力的,仍然是它是否解决了领域中的关键问题。


ECCV Oral 背后,LingBot-Map 如何重新设计机器人空间记忆?


那么,LingBot-Map 究竟解决了什么问题?为什么一个流式 3D 重建模型,能够吸引开发者持续扩展,又能够获得 ECCV Oral 的认可?


答案需要回到机器人空间感知中最核心的挑战:如何让机器人在不断增长的视频输入中,既保持对空间的长期记忆,又避免计算和存储成本随着时间无限增加。


对于机器人而言,3D 重建需要边走边理解环境。机器人看到当前画面,需要同时回答现在看到的位置在哪里?过去走过的区域和当前画面之间是什么关系?


这意味着模型需要持续估计摄像头轨迹,并生成对应的深度信息,最终形成不断扩展的三维地图。


流式重建相比离线重建,要面对一个核心矛盾:保留更多历史信息,可以提升空间一致性;但历史越来越长,也会让计算和存储成本快速增长。


现有方法大致采用三种路线。


一种方法类似记住全部历史。例如基于 causal attention 的方案,会缓存之前所有帧的信息。这样模型拥有完整上下文,但随着序列增长,显存和计算量也不断增加。


另一种方法选择压缩历史状态,例如循环网络式结构。但压缩过度可能导致模型遗忘关键几何信息,长时间运行后出现轨迹漂移。


还有一些方法结合传统 SLAM,通过关键帧选择和优化算法维持稳定性。但这类方法依赖人工设计的规则,并且需要额外优化过程,难以兼顾实时性。


因此,真正困难的问题是机器人面对不断增长的视频流,哪些空间信息必须保留,哪些信息可以舍弃?


LingBot-Map 将这个问题称为 streaming reconstruction 中的 context management(上下文管理)。它希望让模型像人类空间记忆一样,只保留最重要的几何线索,而不是记录所有观察


GCA:把空间记忆拆成三层,让模型知道该记什么


为了解决这个问题,LingBot-Map 提出了 Geometric Context Attention(GCA,几何上下文注意力)


它的核心思想来自传统 SLAM:一个稳定的空间系统,通常需要三类信息:一个固定参考点,用来确定坐标;附近区域的信息,用来判断当前位置;长距离历史,用来避免累计漂移。因此,GCA 将流式状态拆成三个部分。


LingBot-Map 流程。该框架处理相对于初始化集 [T, T) 的当前视图。DINO 骨干网络提取图像特征,然后通过交替的帧注意力层和 GCA 层进行细化。在 GCA 模块中,输入视图聚合来自锚点上下文、局部姿态参考窗口 [T, T] 和轨迹记忆上下文的信息。最后,特定任务的头部预测相机姿态和深度图,从而实现对长序列的鲁棒、内存高效的流式 3D 重建。


第一层:Anchor Context,建立空间坐标。负责记住「我从哪里出发」。它为整个三维坐标系提供稳定基准,空间重建最怕坐标漂移,有了锚点,模型在处理第一万帧时,仍然清楚第一帧发生在什么位置。


第二层:Local Pose-Reference Window,保持局部精确定位。用来负责捕捉当前位置附近的局部几何细节。这相当于对「我身边有什么」保持清醒的即时感知,保证了逐帧重建的精度。


第三层:Trajectory Memory,压缩长期历史避免漂移。这是整个架构中较为关键的设计。它把庞大的历史信息压缩成极其紧凑的逐帧 Token,以较低的存储代价保留对过去路径的「印象」。正是这一机制,让 LingBot-Map 的内存消耗几乎不随视频长度增长,处理 100 帧和处理 10000 帧,总的计算量和内存占用维持在几近相同的水平。


这种设计带来的效率提升相当可观。在 1 万帧序列中,传统 causal attention 需要约 500 万 token;GCA 只需要约 7 万 token,足足压缩了近 80 倍,且每处理一帧新画面,计算量和内存消耗几乎不随总帧数增长。


注意力掩码比较。每个方框代表一帧的 Token,由一小段上下文 Token 和一段较大的图像 Token 组成。(a) 全注意力(Full attention)会关注所有帧。(b) 因果注意力(Causal attention)支持流式处理,但计算开销随序列长度线性增长。(c) 滑动窗口注意力(Sliding-window attention)虽然限制了计算成本,但会丢失长程上下文。(d) GCA 将流式上下文划分为锚框 (n=2)、局部窗口 (k=2) 和轨迹记忆,在保持计算成本随序列长度增加而近乎恒定的同时,保留了丰富的长程上下文信息。


在基准测试上,它表现如何?


实验也验证了 LingBot-Map 有效性。


团队首先在 Oxford Spires 数据集上进行测试,并以两种设置分别测试模型的短程定位能力和长程稳定性。


在稀疏设置中,团队选取 320 帧图像(每隔 12 帧采样)测试,LingBot-Map 在几乎所有指标上都取得了最佳结果。


尽管 LingBot-Map 采用的是流式在线推理方式,但其性能仍大幅超过最强的离线基线方法。具体来看,LingBot-Map 的 AUC@15 达到 61.64,明显高于最佳离线方法 DA3 的 49.84,并超过 VGGT 的两倍以上(VGGT 为 23.84)。在轨迹级别的精度指标上,LingBot-Map 将 ATE 从 DA3 的 12.87 米、VGGT 的 24.78 米降低到了 6.42 米。


相比依赖跨帧重投影误差优化的传统优化方法,LingBot-Map 同样取得了更优表现。它超过了表现最好的优化方法 VIPE,在位姿精度(AUC@15:61.64 vs. 45.35)和轨迹一致性(ATE:6.42 vs. 10.52)两个指标上均取得优势。


而在在线流式方法之间的比较中,优势更加明显。其他流式方法普遍存在严重的记忆遗忘问题:随着序列不断增长,模型会逐渐丢失过去观察到的几何信息,最终导致累计漂移。LingBot-Map 分别达到 61.64 和 6.42,在位姿精度上提升约 10 倍,在轨迹误差上降低约 2.8 倍。



在密集设置(完整 3840 帧)下,团队进一步对模型的长序列流式重建能力进行了压力测试。随着轨迹长度从 320 帧增加到 3840 帧,大多数前馈式方法都会因为累计漂移问题出现明显性能下降。


相比之下,LingBot-Map 始终保持较低的误差水平,ATE 仅从 6.42 增加到 7.11。在序列长度扩大 12 倍的情况下,误差只增加了 0.69。


这说明 GCA 的三层上下文结构 —— 包括 anchor context、trajectory memory 和 local window—— 能够在无需显式优化或回环检测(loop closure)的情况下,有效保持长距离几何一致性。


值得注意的是,LingBot-Map 在保持最高轨迹精度的同时,还达到了具有竞争力的推理速度,运行速度达到 20.29 FPS,在所有流式方法中实现了最佳的轨迹估计效果。



在生成高质量三维地图方面,团队在 ETH3D、7-Scenes、NRGBD 三个数据集测试点云重建。LingBot-Map 均取得最高 F1 分数。



在 ETH3D 数据集上,LingBot-Map 的 F1 达到 98.98,相比第二名 Wint3R 的 77.28 提升了 21.70 个百分点。说明 LingBot-Map 生成的重建结果不仅更加精准,也覆盖了更加完整的场景结构


在 7-Scenes 数据集上,LingBot-Map 的 F1 达到 80.39,并在 Accuracy(0.02)和 Completeness(0.07)两个指标上均取得最佳表现。


在 NRGBD 数据集上,LingBot-Map 的优势更加明显,其 F1 达到 64.26。NRGBD 包含大量复杂室内环境以及精细几何结构,在这类场景中,其他方法由于累计位姿漂移,容易导致重建结果出现表面模糊或结构重复的问题。而 LingBot-Map 具备更强抗漂移能力的轨迹估计,可以直接提升这类场景下的重建质量


下图是定性对比结果。在较简单的场景中(图中上方几组),TTT3R 和 Wint3R 已经出现建筑边缘错位的问题。随着场景复杂度增加(中间几组),竞争方法开始出现重复结构和模糊表面,这是由于累计位姿漂移导致同一几何结构被投影到了不同位置。


在最具挑战性的多建筑室外场景中(底部几组),差距更加明显:TTT3R 和 Wint3R 几乎完全失去空间一致性,生成的点云出现坍缩和碎片化,甚至无法区分独立建筑。相比之下,LingBot-Map 始终保持清晰的几何结构、锐利的建筑边缘以及连续的墙面表面,说明 GCA 提供的长期几何一致性能力能够直接转化为高质量的 3D 重建效果。


点云重建的定性比较。


从一个模型,到一套机器人空间感知体系


其实回看蚂蚁灵波的技术布局,LingBot-Map 并非孤立存在。


对于机器人而言,真正的空间理解并非单一能力。它首先需要看懂眼前的环境,随后需要准确判断距离,最后,还需要把连续观察到的信息整合起来,形成对整个环境的长期记忆。


围绕这三个环节,蚂蚁灵波已经布局了 LingBot-Vision、LingBot-Depth 和 LingBot-Map,分别对应视觉结构理解、高精度空间感知以及持续空间记忆


其中,LingBot-Vision 提出的思路,是让模型重新关注图像中的边界。它认为,物体轮廓和形状变化区域包含大量几何信息,是机器人理解空间的重要线索。基于此,团队提出掩码边界建模(Masked Boundary Modeling),让模型无需人工标注或额外边缘检测器,就能自主学习亚像素级边界表示,并利用这些边界信息增强视觉表征。


LingBot-Depth 的关键洞见是将传感器缺失视为可学习的信息,而非单纯的噪声。通过掩码深度建模(Masked Depth Modeling, MDM),模型能够结合 RGB 图像中的视觉上下文,推断缺失区域的深度信息。这样,机器人不仅能看到物体,还能更准确判断物体在三维空间中的位置关系,尤其在处理透明、反光、密集物体时表现突出。


LingBot-Map 则进一步解决记住的问题,通过流式 3D 重建能力,将连续视频中的视觉信息组织成稳定的三维空间表示,让机器人能够在不断移动过程中更新环境认知,并保持对已经探索区域的记忆。


三者结合起来,形成一条从感知到理解再到行动的空间智能链路。


当机器人能够持续感知、理解并记忆周围环境,它才有可能完成更复杂的导航、巡检、操作和任务执行。LingBot-Map 所推动的,正是机器人从看到世界走向理解并利用世界的关键一步。



© THE END

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]



《npj Robotics》:还在疯狂堆数据?北航、NTU联合提出PhyFilter,让机器人在有限数据下学会举一反三

2026-09-11 14:18:00

图片


智能的本质为「学习不确定性」,核心在于干扰观测、学习与利用。要让机器人在不确定环境下像生物一样「举一反三」,主流答案是把数据堆到大模型的量级。但真机数据的采集成本,让这条路在机器人领域几乎无法复制。


北京航空航天大学郭雷院士团队、北京航天控制仪器研究所王巍院士团队与新加坡南洋理工大学 MARS 团队在 Nature npj Robotics 提出 PhyFilter:把神经网络的学习误差看作一个可以被「滤掉」的低频信号,借助机器人自身的实时状态反馈与已知的物理微分结构,在线修正学习输出。


它是一个即插即用、与具体模型无关的轻量模块,滤波参数还能自动学习、无需手工整定。在四足机器人、无人机、空中作业机械臂与加速度感知四类系统上,仅在平地仿真中训练的策略可以直接跨越石板路、草地、沙地与碎石路,空中机械臂能在 5 m/s 风扰下完成厘米级抓放。


研究表明,物理滤波式的反馈机制,可以成为「堆数据」之外的另一条泛化路径。



  • 论文:https://www.nature.com/articles/s44182-026-00114-y

  • DOI:10.1038/s44182-026-00114-y

  • Website:https://scoardyy.github.io/PhyFilter/

  • Code:https://github.com/JIAjindou/PhyFilter


背景:机器人的泛化,只能靠堆数据吗?


过去十年,大语言模型在海量语料、大规模网络与算力的加持下取得了惊人进展,也让 scaling data 成为通往通用智能的默认路径。但当智能需要落到物理实体上时,这条路径立刻遇到阻力:机器人训练所需的数据必须在物理世界中采集。


一条路是人工遥操作,然而要获得 LLM 量级(数千亿 token)的人类演示,在技术上困难、耗时且昂贵,即便是特斯拉这样的大规模工业化尝试,也仍然卡在采集吞吐与可扩展性上;另一条路是依靠仿真引擎(Isaac Lab、MuJoCo)与视频生成模型(Sora、Cosmos)合成数据,虽然在部分任务上确有收益,但仍受制于 sim-to-real 差距、高昂的计算开销,以及跨平台数据格式、软件与硬件接口缺乏标准化的问题。


研究团队把视角转向生物:生物强大的泛化能力并不只来自「规模化」。大量证据表明,先天或后天获得的物理结构本身就在促进生物对未见环境的适应 —— 皮层的运动响应由前馈信号、反馈回路与先验驱动共同支配,并动态演化以最小化全局能量函数;斑马鱼幼体则会把与生俱来的物理积分结构与实时状态反馈整合进不断更新的小脑内部模型,从而对不可预测的视觉扰动做出有效响应。


这引出了本文要回答的问题:与数字世界中的 LLM 不同,真实机器人本就拥有结构良好的物理先验和来自环境交互的实时反馈,能否把这些「现成的」物理结构利用起来,去改善机器人学习的泛化能力?


核心方法:

把「学习残差」当作可以被滤掉的信号


PhyFilter 的出发点是一个被以往工作忽视的量 —— 学习残差。


对于真实映射与学习得到的模型,二者之差即为学习残差,它来自未见场景中的传感噪声、外部扰动或未建模交互,正是泛化失效的根源。


直觉上,只要能实时知道学习残差,把模型输出进行修正即可;但部署阶段没有标签,学习残差无法直接瞬间获得。生物同样无法「瞬间理解|陌生环境,而是经历一个适应过程。


图 1 | PhyFilter 框架。a 学习输出经物理信息滤波器增强;b PhyFilter 的具体实现;c 四类代表性验证平台:四足运动、无人机飞行、空中作业机械臂与加速度感知。


受人类视觉与听觉感知系统中普遍存在的低通滤波特性启发,团队把目标写成一个高阶低通滤波形式。若滤波形式能实现,学习残差的低频特征就能被收敛地捕捉并及时补偿;低通滤波器的收敛过程,本身就可以被视为机器人在未见场景中的一次自适应。


真正的技术难点在于学习残差不可测。团队的做法是引入机器人自身的实时状态反馈与先验的微分方程结构,把原本需要高阶导数与学习残差的形式,等价重写为只依赖可测量信号的实现,从而彻底避开了对标称模型的直接高阶微分。


由此得到的 PhyFilter 具有几个关键特性:


其一,即插即用。与以往需要重新训练被改造网络的 physics-informed 方法不同,PhyFilter 是一个模型无关的轻量模块,可直接部署在已训练好的模型上;


其二,可退化、可扩展。在一阶滤波器设定下,该实现会退化为纯粹的反馈式扰动观测器,而高阶形式则能处理超出一阶情形的复杂残差;


其三,参数可自动学习。滤波参数原本要靠成熟但繁琐的极点配置手工整定,阶次一高就极不直观。团队把滤波参数重新解释为一个动力系统的控制输入,把整定问题转化为最优控制问题,再用 Lagrange 乘子法配合伴随法(反向模式微分)解析地计算梯度,配合 Adam、小批量与早停进行优化。实验显示,自动学到的参数与人工精心调出的参数基本一致。


计算开销方面,在无人机飞行与空中作业机械臂实验中,PhyFilter 在 STM32F765 微控制器上以 500 Hz 实时运行,证明其适用于资源受限的轻量平台。


评估:四类真实机器人系统


团队在四足运动、无人机机动飞行、空中作业机械臂与加速度感知四个代表性场景中验证了 PhyFilter,其中前者属于强化学习(RL),后三者属于监督学习(SL),覆盖了当前机器人学习的两条主流范式。


四足运动:只在平地仿真训练,直接跨越四种真实地形。


为了突出泛化能力,仿真训练环境只包含平地,且仅使用标准参数随机化。结果显示,在五个随机种子下,加入 PhyFilter 的策略最大训练回报一致高于基线,步态也更协调 —— 这说明一个鲁棒的底层控制器可以显著提升上层 RL 策略的训练效率。


泛化测试中,机器人被要求以训练集之外的 2.83 m/s 高速运动,并承受 15%~60% 机身重量(11.86 kg)的额外负载,最高超出训练上限 137.33%。在楼梯、水平粗糙路、坡面粗糙路、波浪地面与碎石路五类未见场景中,PhyFilter 的通过成功率分别为 70%、80%、50%、80%、40%,而基线为 0%、0%、10%、20%、0%,结合了自适应控制的 RL2AC 为 0%、20%、10%、50%、0%。


图 2 | 四足真机实验。策略仅在仿真平地训练、无任何部署后调参,直接测试石板路、草地、沙地与碎石路(左:基线,右:PhyFilter)。


真机部署同样不做任何调参。基线策略在沙地与碎石路上迅速失稳倾覆,而 PhyFilter 引导的策略在全部地形上稳定行走。一个更有意思的发现是:即使在部署时把修正项关闭,该策略依然能成功迁移到各类真实地形 —— 这说明 PhyFilter 塑造出的是一个本质上更优的策略,而不只是在运行时 "打补丁"。


无人机机动飞行:即插即用地补上泛化短板。


在监督学习场景中,团队把 PhyFilter 叠加在之前 SEER-I 之上。SEER-I 通过离线基函数学习结合在线自适应控制,能有效捕捉无人机的质量不确定性,但一旦引入风扰这类不同性质的未知扰动,其跟踪性能就明显退化。


在 2 m/s 圆轨迹跟踪任务中,加入 PhyFilter 后,平均绝对跟踪误差相比 SEER-I 降低 30.22%,相比基线降低 50.17%。进一步的不确定性估计对比显示,SEER-I 只能捕捉质量不确定性,而 PhyFilter 能同时辨识风致扰动与固有动力学不确定性。


图 3 | 无人机实验结果。训练阶段只考虑质量不确定性,测试阶段额外引入风扰。


空中作业机械臂:5 m/s 风扰下的厘米级抓放。


空中作业机械臂需要在强耦合动力学与外部扰动下实现高精度末端控制。团队设计了一项应急救援风格的取放任务:机械臂需从三脚架上精确取下药品并放入指定区域,最大允许跟踪误差仅 2.5 cm。实验中用一台 380 W 风扇制造最高 5 m/s 的风速,并额外引入 0.3 kg 的未建模负载。


结果显示,基线与 SEER-I 都因未见风扰与质量不确定性而抓取失败,只有 PhyFilter 完成了全部四个阶段,跟踪误差相比基线在均值与方差上分别改善了 23.99% 与 55.04%。


图 4 | 空中作业机械臂实验。a–c 基线、SEER-I 与 PhyFilter 的取放执行过程;e–f 三维跟踪性能与误差对比。


加速度感知:分布漂移下依然可靠的神经微分器。


对无人机这类缺乏高精度感知硬件的轻量平台,加速度估计尤为困难。团队用真实飞行数据训练一个两隐层神经网络,把历史速度映射为加速度,训练集速度为 0~2 m/s,测试集为 0~3 m/s。纯学习模型在测试集上出现明显的泛化失效,而引入运动学结构知识的 PhyFilter 精度最高,优于鲁棒微分器(RD)、跟踪微分器(TD)与离散微分器(DD)等经过精心调参的经典基线,并在 0.002~0.018 s 的采样间隔范围内保持一致优势。


图 5 | 加速度感知实验。e 滤波阶次与极点的消融,星号为自动学习得到的参数;g 不同采样间隔下的 RMSE 对比。


把四个案例放在一起看,结论相当清晰:为了弥合 sim-to-real 差距,现有主流范式依赖域随机化 —— 本质上是在众多随机环境中追求平均性能,用精度换鲁棒性,与经典鲁棒控制的思路相似。而 PhyFilter 不需要过度的域随机化,就能在同一个框架内统一泛化与精度:当机器人进入训练分布之外的场景时,PhyFilter 被激活以增强泛化;而在残差本就很小的熟悉工况中,干预会自适应地衰减,从而保留原有精度。这也意味着训练阶段可以省下大量为构造有效随机化参数而付出的工程调参成本。


提升空间与发展潜力


该工作存在三点局限,它们同时也是后续的研究方向。


其一,目前 PhyFilter 只增强学习的「输出」。更聪明的做法,是把滤波过程中获得的知识反过来用于精化原网络的参数或结构,持续学习(continual learning)可能是实现这一目标的可行路径。


其二,参数自动学习算法虽然可靠,但每一次迭代都需要一次完整的前向轨迹 rollout,这限制了它在大规模数据上的效率,截断式或并行化 rollout 是值得探索的改进方向。


其三,学习残差 中除了神经网络预测误差,还可能混合其他不确定性 —— 例如四足案例中的建模失配。如何把这些成分解耦开来(例如借助元学习),仍是开放问题。


总体而言,PhyFilter 提供了一个与 "数据规模化" 互补的思路:机器人不是缺少物理先验的图像生成器,它本来就拥有结构良好的动力学模型和源源不断的实时反馈。把这些既有的物理结构用起来,也许比无止境地扩充数据集更接近生物式泛化的本质。


主要作者信息


贾金豆(Project leader):新加坡南洋理工大学 MARS Lab 博士后,研究方向包括 VLA、WAM、PINN 等。在顶级 AI、机器人、控制期刊会议上以第一 / 共一作者发表多篇论文(IJRR、TRO、ICLR、RAL、CoRL、ICRA、RSS 等)。

主页:https://jiajindou.github.io/


郭克信(通讯作者):北京航空航天大学航空科学与工程学院教授,博士生导师,国家级青年人才,主要从事无人飞行器智能自主控制、多无人系统协同控制、卫星拒止下无人系统定位、空中灵巧操控等方向的理论与应用研究。在 IJRR、IEEE 汇刊 (包括 IEEE T-RO、T-Cyber、T-AES、T-IE、T-II、T-ASE、RA-L)、ICLR、ICRA、AIAA JGCD 等顶会和期刊发表多篇论文。

主页:https://shi.buaa.edu.cn/guokexin1


杨剑飞(通讯作者):新加坡南洋理工大学机械与宇航学院和电子与电气工程学院双聘助理教授,博士生导师,MARS Lab 负责人,主要研究方向为多模态人工智能与机器人。在顶级 AI 会议与期刊上发表多篇论文(IJRR, NeurIPS, ICLR, CVPR, CoRL, ICCV, ECCV, ACL, AAAI, MobiCom, IROS, IJCV, TIP, TNNLS, TMC, IOT-J, TCYBE、RSS 等)。

主页:https://marsyang.site/


图片


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]


openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

2026-09-11 13:02:00

机器之心发布


让智能体完成一次任务已经不难,难的是让它从每一次任务中学会改进。当前多数智能体还是 "交付即定型":遇到失败,需要人工复盘日志、修改提示词、补充工具、再重新测试。调优成本高、周期长,有效经验也难以积累。


这正是 RSI(Recursive Self-Improvement,递归自我改进)要解决的问题。 它不是让模型自己训练自己,而是让智能体从真实任务反馈中生成改进方案、执行验证、保留有效改进,帮助智能体持续优化。


早在今年 6 月,由华为 2012 实验室、华为云、终端、计算等团队联合构建的开源 AI Agent 平台 openJiuwen 即发布了 Auto Harness 能力,让智能体能够自动优化自己的一整套 "工作装备"。这一次,openJiuwen 把完整的 RSI 框架落地到了 WorkSwarm 蜂群办公智能体上,率先支持 "可插拔的 Harness + Artifacts" 双维度优化,Artifact 当前包含科研论文和算法程序两类交付产物优化,同时结合 openJiuwen 的算力亲和能力,把多轮优化的成本和耗时压了下来。


对于横跨文档、代码、数据和工具的办公任务,这意味着工作方法可以改进,交付物可以持续打磨,成功与失败的经验也能为后续任务所用。用户像创建普通任务一样发起实验,就能查看优化过程,获得经过验证的成果。



openJiuwen RSI 框架:让自我迭代真正跑起来的工程闭环


openJiuwen RSI 不是一套固定的优化算法,而是让不同自我迭代任务都能稳定运行的工程框架。它以版本化优化对象、可验证的执行证据和可扩展的算法为核心,通过四层协作,把任务目标转化为可执行、可评估的改进过程。



任务层定义 "优化什么、如何评价、能用多少资源";迭代优化层决定 "下一步试什么、哪些改进可以采纳";执行层负责 "真正跑起来并返回证据";基础框架层提供运行、模型与上下文、沙箱隔离、状态恢复和可观测性等统一能力。


整个流程串起了六阶段闭环:评测与验证建立基线;分析与优化定位从失败、轨迹和指标中找到原因;提案与构建生成候选,再按同一标准重新评测;采纳与融合消解冲突、组合有效改进,形成新版本;RSI 经验沉淀提炼方法及适用条件;最后通过归档与停止保存结果、判断是否结束。只要还有预算和改进空间,就会选择父版本继续迭代。


可靠性来自明确的分工。AgentLoop 负责单次任务的 “推理 — 行动 — 观察 — 反馈”,控制器负责跨版本优化,避免用生成者的主观判断代替验证。每份证据都绑定版本和评价上下文,候选经过过滤、融合或配置变更后必须重测;执行失败、证据无效和效果不佳也会分别记录。问题、假设、改进点及采纳或未采纳的原因都会保留,让下一轮既能借鉴成功,也能避开无效方向。


在统一的任务表达、阶段接口和生命周期下,不同对象可以采用各自的算法:


  • 科研论文优化接收研究目标、初稿或实验材料及评价标准,通过 Frontier 选择父版本,提出研究方案,构建包含研究内容和实验结果的论文,再经论文评测决定是否采纳。

  • 科研算法程序优化接收程序文件树、任务数据和标准,通过 PUCT 选择父版本、安排搜索,生成源码修改或修复方案。候选构建运行后,以脚本评测、规则匹配和指标聚合比较效果,指导下一轮搜索。

  • Harness 优化先运行当前版本,依据任务结果和轨迹诊断,再装载候选重跑同一组任务。只有经过自身评测的改进才能被采纳,方法及适用条件也会随之沉淀。


这套框架已经做进 WorkSwarm:新增的 "实验" 模式下,用户可以像创建普通任务一样发起 Harness 优化或产物优化,查看每一轮的改进过程和搜索路径,最终拿到经过验证的 Harness 插件或论文、程序产物。下面分别看三类优化在 WorkSwarm 里的实战案例。


1、Harness 优化:四步把失败案例变成即装即用的新能力


Harness 是智能体的 “工作装备”:Prompt 决定如何理解任务,Skill 提供专业方法,Tool 负责实际操作,Rail 则约束执行过程。当问题出在这些环节时,WorkSwarm 可以直接从失败案例入手,帮助用户改进装备。


1)构建优化数据。准备一份 JSON 评测集,每条用例包含用例标识、任务要求、评测方式,以及参考答案和评分规则。建议优先选真实失败过的任务。


[  {    "id": "case_001",    "input": "需要 Agent 完成的任务",    "judge_method": "llm",    "reference": {      "solution": "参考答案",      "judge_rubrics": "评分规则"    }  }]


2)创建实验。进入 WorkSwarm 的 "实验" 页面选择 "Harness 优化",填写实验名称,选择优化模型、测试模型和初始插件,再选择评测集、评测方式和最大迭代轮次,即可创建。


3)自动迭代。WorkSwarm 先运行当前 Harness 建立基线,再从失败用例和执行轨迹中定位问题,围绕 Prompt、Skill、Tool 和 Rail 生成候选修改。候选先验证目标用例确实修好,再回放完整评测集确认整体有提升、没有改坏原本通过的任务。页面持续展示得分、迭代轮次、模型用量和搜索树,哪些方案试过、哪些被采纳,一目了然。


4)安装使用。实验产出有效版本后,点击 "安装插件",最优 Harness 即作为插件包导入并热加载,不用手工复制任何内容;版本信息保留,需要时可以回退。



在 DeepSeek-V4-Flash 任务模型、最多 5 个 Epoch 的配置下,Harness 优化在 SWE-bench Lite Dev 全部 23 道题上的通过率由 61.0% 提升至 87.0%;冻结优化后的 Harness 后,在 Evo-Bench General 64 道独立评测题上的单次执行通过率由 60.9% 提升至 71.9%。结果表明,优化收益不仅覆盖参与迭代的任务,也能泛化到未参与优化的任务。



2、科研论文产物优化:从研究构想到论文成稿,持续打磨


在 WorkSwarm 中,既可以从一个科研构想出发生成科研论文,也可以提交已有科研论文继续优化。


在 "实验" 页面依次选择 "产物优化" 和 "论文",填写优化指令(研究主题、目标问题或重点改进方向)或选择本地论文文件夹,设置最大迭代轮次,即可创建。


运行期间,详情页展示当前分数、最优论文、模型用量和迭代轮次;论文优化树记录每一轮产生的版本,点击节点可以看到本轮改动、评测结果以及未被采用的原因。实验完成后,预览当前最优产物,确认后一键下载完整论文。



3、科研算法程序产物优化:提交任务包,寻找更优版本


对于可以运行和评价的算法程序,WorkSwarm 支持从现有实现出发自动尝试多个版本,交付最优结果。


首先准备待优化的初始科研算法程序及其评价配置。推荐预先安装并调用 rsi-program-dataset-creator Skill,生成包含初始程序、scorecard 等运行和评价信息的任务包,再在 "实验" 页面依次选择 "产物优化" 和 "程序",选择任务包文件夹,即可创建与启动优化。


优化过程中详情页展示当前最优分数、模型用量和程序优化树,每个节点是一个候选程序,点击可查看改动、评测结果和失败原因;中途可以暂停,之后再继续。实验完成后,一键下载经过多轮尝试和评测筛选的最优程序,用于后续验证、集成或开发



4、算力亲和:把 RSI 多轮优化的成本降下来


RSI 的本质是拿算力换智力:反复生成候选、执行任务、评测结果,一次完整实验动辄成千上万次模型调用;优化过程中,提示词、工具描述和任务材料会反复使用,工具调用、评测和重试又带来频繁的暂停与恢复。如果每轮都重新计算相似上下文,优化规模越大,等待和资源开销就越高。


openJiuwen 算力亲和依托昇腾算力基础设施,让推理引擎 "读懂" 智能体的任务状态,框架通过 Agent Hint 把任务运行、等待、恢复和结束等信息传给引擎,帮助引擎在昇腾 NPU 显存、鲲鹏 CPU 内存和远端缓存池之间主动调度上下文缓存(KV Cache):等待时卸载到低成本存储,恢复前提前预取,结束后及时释放。从而降低多轮优化的时延与资源开销,让智能体在持续改进的同时更高效地使用算力。


在科研算法程序优化的实验中也验证了这一收益,开启算力亲和后,TTFT(首 Token 时延)均值下降 15.83%、P90 下降 19.16%;Token 加权 KV Cache 命中率由 7.53% 提升至 14.36%;HBM 与 DDR 峰值使用率分别下降 22.82% 与 30.74%。重复 Prefill 少了,首 Token 更快,存储压力也更低。



结语


openJiuwen RSI 已经形成一条从创建实验到获得优化结果的完整链路:


  • Harness 优化会根据失败案例改进智能体的工作方式;

  • Artifacts 优化打磨科研论文和算法程序等交付产物;

  • 再结合算力亲和,减少重复计算,降低资源开销。


从 Harness 到 Artifacts 的双维度优化,openJiuwen RSI 让优化成为用户可以发起、观察和复用的持续流程:每次改变都有证据,每次采纳都经验证,每轮经验都能帮助下一轮。


后续框架将继续丰富搜索、评测与融合算法,增强跨任务经验复用,并沿统一架构接入模型优化与混合优化,让 Harness、Artifacts 和 Models 在明确的评价标准、预算与安全边界内协同迭代。


RSI 实验模式已在 WorkSwarm 上线,感兴趣的用户可前往官网一键下载,立即体验:


  • WorkSwarm 立即体验:https://openjiuwen.com/workswarm

  • GitHub 代码仓:https://github.com/openJiuwen-ai/

  • AtomGit 代码仓:https://atomgit.com/openJiuwen/



© THE END

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]