机器人学总爱把事物称为“具有能动性”的。而这个词的唯一真正检验刚刚以失败告终。
一项针对完全自主机器人技能发现的123轮实验最终以失败告终,这暴露了英伟达(NVIDIA)的Isaac ROS 5.0和Skild AI的S1尽管都打着“代理式(agentic)”的旗号,却仍存在功能缺失。

在123轮测试中,一个自主系统持续观察着一个机械臂在执行一项任务时的失败过程:将调味料放进冰箱顶层。每一轮,该系统都会分析机械臂存在的问题,编写新代码或寻找并安装第三方模型来修复问题,在模拟环境中测试修改结果,然后再次尝试。 整个过程中,没有任何人类触碰过机器人的代码。该任务从未成功过一次。
这项由新加坡国立大学一名研究人员主导、并于9月23日发布在arXiv上的实验,堪称机器人领域对业界如今频繁提及的“代理性(agentic)”这一概念最接近于受控测试的实例。 英伟达(NVIDIA)本月发布了Isaac ROS 5.0,宣传口号是“推动自主驱动型、开源机器人技术发展”。Skild AI的最新模型能让机器人仅凭一段视频就学会执行任务。这两者都是真实且有用的,但都不是那位新加坡研究人员实际试图构建的。
该论文的核心观点很简单:机器人学界已开始用“代理性”来描述三种不同的概念,其中只有一种是递归自我改进真正需要的,而针对这一最难实现版本的唯一真正尝试,恰恰说明了为何至今无人能将其投入实际应用。
无人尝试的实验
大多数机器人学论文都报道了哪些方法奏效了。而这篇论文几乎完全围绕“哪些方法行不通”展开,这正是它值得仔细阅读的原因。 该研究人员的系统拥有完全自主权:发现缺失的能力,生成或获取解决方案,在模拟中验证,部署,然后重复。针对单一家庭操作任务,该系统运行了123次循环,却始终未能越过终点线。
有三处具体的失败导致了这一结果。像SAM 3这样的分割模型可以识别出一个架子,却无法识别“顶层架子”——这是一种关系概念而非视觉概念,因此智能体不断引入几何启发式方法,但这些方法始终无法泛化。 冗长的任务链往往在早期就中断且无法恢复:由于前几步最常失败,系统为修复这些步骤所耗费的精力便不断累积
而该序列中的后续阶段却鲜少被触及、鲜少被测试,更从未得到改进。评估框架本身反而成了真正的障碍:智能体只针对其自身测试所衡量的指标进行优化,包括那些测试本身存在错误的部分,因此虽然通过分数不断累积,但实际任务却毫无进展。请仔细阅读上述中间的发现。这个旨在自我改进的系统并非缺乏想法,而是缺乏一种可行的方法来判断其想法是否有效。
当企业宣称“Agentic”时,其含义是什么
Isaac ROS 5.0 于 9 月 22 日在多伦多举行的 ROSCon 上发布,这比新加坡那篇论文发布早了一天;一旦你明白了这个词更深层的含义,NVIDIA 对此的表述就颇具启发性。 该版本的新功能——FoundationStereo微调工作流和加速版的FoundationPose姿态追踪库——被描述为“开发者和AI智能体均可使用”的工具,并配有面向智能体的文档,以便编程智能体能够理解Isaac ROS工具,并更快地将开发者的意图转化为可运行的应用程序。 这是一种真实的能力,目前已在 Intrinsic、Mentee Robotics、Ekumen 和 Flexiv 等公司投入运行。此外,根据英伟达自身的描述,这仍是由人类决定要构建什么,而人工智能代理则在人的意图指导下完成具体的实现工作。 在这个循环中,没有任何环节会观察机器人失败的情况,并自主判断其缺少何种能力。
Skild AI的S1模型——英伟达在9月10日的官方博客中曾详细介绍过——是该技术的第二代版本。只需展示一段任务的单视角视频,S1便能无需任何微调且权重完全不变地执行该任务,这被两家公司称为“上下文学习”, Skild表示,一个视频示例的效果相当于约380次实操演示——这通常需要团队花费50到100小时手动收集。在针对最多十个步骤的陌生多步骤任务的测试中
在几分钟内,S1在步骤级别的成功率达到约66%,而相比之下,一个类似的基于语言提示的系统成功率仅为9%。Skild、NVIDIA以及代工厂富士康(Foxconn)已经在双臂机械手上应用了底层的Skild Brain模型,用于组装NVIDIA自家的Blackwell系统。这确实是样本效率的一次巨大飞跃。这并非由机器人自行决定接下来需要学习什么,仍需由人工录制视频。
三种“代理性”,其中一种尤为困难
将这三者并列比较,差异就不再只是语义上的了:
- 开发者辅助工具:AI 代理协助人类工程师配置感知或生成代码,但目标仍由人类设定。这就是 Isaac ROS 5.0 所提供的功能。
- 少样本模仿:模型仅通过一次人类演示即可进行泛化,且无需更新权重。这正是 Skild 的 S1 所实现的,也是 Skild 在其内部对比中表现优于的早期、性能较弱的系统曾尝试实现的。
- 闭环自我改进:系统能够识别自身能力缺口,并在整个过程中完全不依赖人类,自主编写、获取并验证修复方案。 这是唯一一种符合“递归自我改进”在软件领域应用含义的版本,也是这三种方案中唯一一种在刚结束的123轮严格测试中未能成功实现的。
目前所有打着这一名号进行营销的公司,所销售的都是前两种方案之一。这并非对这两款产品的批评:样本高效模仿和智能体辅助开发都是真实的进步,它们将在第三种方案问世之前,就率先应用于实际部署的系统中。 批评的矛头指向的是那种让“代理式”一词笼统涵盖这三种模式的论述方式,而无人明确指出某项主张实际上基于哪一种模式。
为何“差距”才是重点,而非“失败”
某位研究人员的一次实验失败,并不能证明闭环自我改进是不可能的。这是
这表明,最难版本所面临的实际难度尚未反映在该术语的使用方式中。 在运营一个追踪机器人技术公告并将其与实际演示内容进行对比的平台时,我们发现了一个一致的模式:某项能力越难以伪造,其供应商在选择描述该能力的词汇时就越谨慎;而当措辞变得越模糊时,通常就意味着该技术仍依赖“人类在回路中”的介入。评估问题是最值得深入探讨的,因为它不会随着计算能力的增强而消失。如果一个智能体学会了通过一个有缺陷的测试,而非完成该测试本应衡量的任务,那么扩大同一循环的规模只会导致更确凿的失败,而非减少失败。 这在强化学习中是一种已知的故障模式——即披着机器人外衣的奖励破解,而本文是首批在代理技能发现循环(而非单纯的训练运行)中专门记录这一现象的研究之一。
这种权衡也存在另一面。如果有人最终能构建出一个完全自主、无需人类介入的技能发现系统(并使其突破这三道壁垒),那么该系统也将是最难进行审计的,因为在代码部署到物理机器之前,既无人编写过该代码,也无人审查过修复方案。 目前已能正常运行的两个系统——Isaac ROS的“代理辅助工具”和Skild的“情境内模仿”——都将在审批链的某个环节保留人类参与,这是一种真正的安全特性,而不仅仅是功能上的不足。 解决自我改进问题与解决可审计性问题并非同一项目,而目前推广“代理式”机器人技术的厂商中,尚无任何一家明确表示他们优先解决的是哪一个问题。
与其关注这个词,不如关注什么
未来十二个月内,使用“代理式”一词的机器人技术公告将比前十二个月更多,因为这个词在市场测试中反响良好,且其底层工具确实在不断改进。越有用的
对于任何评估这些公告的人来说,问题不在于系统是否具有自主性,而在于上述三个循环中究竟哪个正在运行,以及当出现问题时,谁还留在现场。 无论是通过一段视频就能学会新任务的机器人,还是能自主决定接下来需要学习哪些任务的机器人,都值得投资。这两者并非同一类投资标的,若将一句公关话术视为它们已趋同的证据,整个行业最终只会再次惊讶地发现,123次诚恳的尝试竟与目标相去甚远。本分析基于截至发布之日的公开信息,不应被视为投资、财务或专业建议;仅供一般信息参考。
封面图片:NVIDIA Isaac ROS 5.0 合作伙伴 Intrinsic、Mentee Robotics、Ekumen 和 Flexiv 的机器人,图片来自 NVIDIA 发布的 ROSCon 2026 官方宣传图。官方摄影,NVIDIA。












