RobotAIGeek

一个类人机器人被要求换个灯泡。英伟达的旗舰AI与一个完全无所事事的机器人打成平手。

一项名为Fiatlux的新开放式基准测试,让Unitree G1人形机器人在一连贯的场景中完成了爬梯子和更换顶灯灯泡的任务。 NVIDIA的旗舰模型GR00T N1.7在统计上与“什么都不做”的策略得分相同,甚至连人类专家的远程操作也无法完成爬梯子这一子任务,这表明真正的瓶颈在于全身控制,而非AI推理。

martti
4分钟阅读Posted: 2026年10月2日
一个类人机器人被要求换个灯泡。英伟达的旗舰AI与一个完全无所事事的机器人打成平手。

将一个独立式A字形梯子放在类人机器人面前。命令它爬上去,从顶灯上拧下烧坏的灯泡,小心翼翼地把它拿下来(不要掉落),拧上一个新的灯泡,然后爬下来。 一个能力正常的成年人无需任何训练,不到两分钟就能完成这些操作。本周发表在arXiv上的一项基准测试,将这一具体任务交给了机器人行业中最好的公开基础模型,而从统计学角度来看,该模型的表现与完全不发出任何指令的策略持平。

这就是本专栏的论点:类人机器人行业一直以演示效果的好坏来衡量进展,而一个新的公开基准测试刚刚表明,真正的瓶颈并非大家都在资助的AI大脑,而是它下方的躯体。 迄今为止,还没有人能弥合这一差距——无论是领先的视觉-语言-动作模型,还是手动编写的控制器,甚至更令人不安的是,连通过遥控操作同一台机器人的人类专家也未能做到。

该基准测试名为Fiatlux,由五位研究人员共同开发——其中四人隶属于夏威夷大学马诺阿分校,一人与普渡大学联合参与——作为NVIDIA Isaac Lab模拟器的原生扩展。 该基准测试针对的是Unitree G1——一款身高1.3米、重约35公斤的人形机器人,Unitree公司目前已将其以16,000美元的起售价投入市场。这并非概念机器人,而是您今天即可订购的硬件,它执行着每一位楼宇维护人员不假思索就能完成的任务。

旨在揭示隐性差距的测试

大多数类人机器人基准测试会分别评估行走和操作能力。HumanoidBench 在 61 个自由度的动作空间内评估 15 项全身操作任务和 12 项行走任务,但每项任务都是独立运行的。 RoboCasa及其更大型的扩展版本RoboCasa365,针对超过150个物体类别和100项评估任务对厨房操作能力进行评分,但完全不包含攀爬环节。这两个系列都没有要求机器人在攀爬时搬运易碎物品,因为

负重攀爬与负重行走在控制问题上有所不同。

Fiatlux 将这两者融合在了一起。这是一个持续1,440秒的连续片段,包含十二个按顺序计分的原子级子任务: 将梯子移至指定位置、攀爬梯子、拆下旧灯泡、手持灯泡下梯、将其运至废弃物箱、处理废弃物、靠近新灯泡、抓取新灯泡、将其带回梯子旁、手持新灯泡攀爬、拧紧灯泡,最后下梯。 该机器人的双手设计为:若闭合力超过50牛顿,就会压碎灯泡;因此,该基准测试也在悄然检验:机器能否同时具备足够的力量来攀爬,又足够轻柔以避免弄坏手中所携带的物品。

这句话值得我们细细品味。一个系统必须在同一时刻既具备攀爬所需的足够力量,又具备不弄坏手中物品所需的足够轻柔。

每个类人机器人投资者都应警惕的数字

英伟达(NVIDIA)的GR00T N1.7显然是用于此类基准测试的理想模型。该模型于2026年7月正式发布,采用Apache 2.0许可证,并在约20,000小时的人类第一人称视角视频以及双臂和类人机器人数据集上进行了训练。 无论从何种公正的角度来看,它都是当前该领域资质最雄厚、公开可用的视觉-语言-动作模型。

在Fiatlux的十二个子任务上进行零样本测试时,GR00T N1.7的加权得分为0.0876。而将所有关节保持在默认位置且不发出任何指令的基线策略得分为0.0861。 而采用随机动作采样的策略得分则为0.0569。该旗舰模型与完全不采取任何动作之间的差距,甚至小于上述任一得分的标准差。论文作者对此进行了直白对比:GR00T N1.7与零动作基线模型无法区分。

零次完成。不是较低,而是零。在全部十二个子任务中,针对四个随机布局种子中的每一个,GR00T N1.7的实际成功率均为0.00。其加权得分中那些微小的正数是

为接近目标而获得的分数是部分的,绝不会因为达到目标而获得。
那个人也爬不上梯子

以下这一发现彻底重塑了整个故事的框架。 研究人员还记录了人类专家的遥操作过程:一名操作员佩戴PICO 4头显,通过反向运动学控制G1的双臂,同时由全身控制器控制双腿。在不涉及攀爬的八项子任务中,遥操作几乎每次都能通过成功门槛,加权得分为0.84。 而在需要攀爬的四个子任务中——爬上梯子、带着灯泡下梯、带着新灯泡爬上梯子,以及再次下梯——没有任何一次远程操作记录能满足该基准测试自身的成功标准。一次都没有。

即使由人类在基准测试自身的安全限制范围内,带着充分的意图并直接控制同一套硬件,也无法可靠地让这台特定机器人在携带易碎物品的同时,沿A型梯上下攀爬。这并非人工智能能力的问题。 这是一个硬件和全身控制的问题,无论语言模型的推理能力如何提升,都无法单独解决。

更换灯泡最难的部分从来都不是灯泡本身,而是那架梯子。

东盟买家为何应关注一篇模拟研究论文

我阅读了大量针对该平台的人形机器人供应商推介资料,其中几乎所有案例都局限于平地场景:仓库拣货、预设问候语、导览式工厂参观。这并非怯懦。Fiatlux 对此给出了相当精准的解释。 马尼拉或雅加达的设施维护采购人员,若正在评估人形机器人是否能胜任本基准测试所模拟的具体工作——即需要借助梯子维修高处灯具——就应当将“负重全身攀爬”视为一个尚未解决的类别,而非下个产品周期才会推出的功能。

这并不意味着类人机器人是“ vaporware”(虚无产品)。Fiatlux 中的八项非攀爬子任务——在房间内导航、拾取物体、搬运物体以及放置物体

确切地说——在遥控操作下表现明显更佳,而在该领域的其他自主模式下也正稳步提升。其中的权衡关系很明确:对于平地检查和分拣工作,可以信赖供应商的路线图;但对于任何暗示“楼梯、梯子或脚手架功能即将推出”的宣传,则应提出基于基准测试的尖锐问题。
究竟是什么推动了这一数据的提升

该行业的惯常做法是等待更大规模的模型,并假设分数会自然提升。Fiatlux 则直接反驳了这种做法。 一个预训练的通用视觉-语言-动作模型,其表现与被要求“什么都不做”的机器人持平——这意味着,仅凭更多的参数和更长的视频训练时长,并不能解决连研究人员自己的专业操作员都无法手动解决的控制问题。缺失的并非语言理解能力。 而是专为多肢体接触过渡设计的全身控制器——包括从一个踏板到另一个踏板的重心转移、质心管理以及抓握力控制等,本文将此类问题视为一个独立且未解决的研究课题,与目前占据资金头条的视觉-语言-动作栈截然不同。

未来十二个月将涌现比过去十二个月更多的类人机器人演示视频,其中大多数出于合理原因,都是在平坦且容错性高的地面上拍摄的。值得关注的数字并非下一段视频看起来有多精致,而是任何发布的策略——无论是自主模式还是遥操作模式——能否在Fiatlux的四个攀爬子任务中取得非零且无差错的成功率。 一个由计算领域最有价值的公司之一支持的、采用Apache许可证的模型,其表现竟与一个完全无所作为的机器人持平。在该具体数值发生变化之前,销售演示文稿中展示的人形机器人爬梯子,不过是噱头,而非实际能力。

本分析反映了截至发布之日的公开研究和产品信息,不应被视为投资、财务或专业建议;其仅供一般参考。

仅供参考。

主图:Unitree G1人形机器人,官方产品照片,Unitree Robotics(unitree.com)。

HumanoidRobotsNVIDIAUnitreeVLAModelsRoboticsResearchBenchmarksWholeBodyControl