RobotAIGeek

类人机器人足球赛已成为该行业最客观的基准

一个由清华大学牵头的团队在《Science Robotics》上发表了一项强化学习控制器研究,该控制器将视觉与运动融合应用于Booster T1类人机器人,将球体追踪误差降低了46%,并在无需任何真实环境微调的情况下实现了90%的射门成功率。 其背后的技术基础同样至关重要:Booster硬件现已承担了竞技机器人足球比赛的大部分内容,而该训练方法为类人机器人未来将面临的各类动态任务指明了方向。

martti
4分钟阅读Posted: 2026年9月2日
类人机器人足球赛已成为该行业最客观的基准

北京某实验室公布的三组数据,比今年任何一场主题演讲都更能说明人形机器人的现状。 球轨迹追踪误差降低了46%。机器人调整射门姿势所需的时间缩短了64%。在足球场前半场射门时的命中率高达约90%——这一成就来自一台机器人,它学会了将“观察、奔跑和射门”整合为单一反射动作,而非由独立的软件模块分别控制。

支撑这些数据的研究成果于8月19日发表在《Science Robotics》上,并作为该期刊人形机器人特刊的封面文章。 清华大学自动化系的研究人员与字节跳动Seed团队及中国农业大学的合作者共同训练了一台类人机器人,使其通过强化学习控制器追逐并踢中移动的足球,随后在实体机器人上运行该系统,且无需进行现实世界的精细调校。

该硬件来自北京公司Booster Robotics,该公司专注于开发面向开发者的类人机器人平台,而非工厂劳动力机器人。 其T1机型已成为竞技机器人足球的标配机型,新款旗舰机型T2 Pro搭载了NVIDIA Thor芯片(运算速度达每秒2,070万亿次),而入门级机型K1起售价为5,999美元,这一价格更接近游戏电脑而非工业机器人。 在8月31日发布的采访中,该论文的第一作者王宇诗和通讯作者赵明国教授解释了为何采用这种系统架构,他们的回答对于任何评估人形机器人在实际工作中应用价值的人都至关重要。

模块化软件从未解决的“反射问题”

几十年来,机器人的自主性一直被构建为一场接力赛。摄像头向检测器传输数据,检测器向状态估计器传输数据,状态估计器向规划器传输数据,规划器再将指令传递给步态控制器。每次交接都要耗费几毫秒,而每个模块都信任前一个模块提供的信息是准确的。 但在足球场上,这些环节无一可信。当机器人抬头时,球影已变得模糊……

随着动作展开,聚光灯将白色的六边形照得一片模糊,而就在最不该出现的时候,对手的一条腿挡住了目标。

赵先生多年来一直带领队伍参加“机器人世界杯”(RoboCup)——这项自1997年以来一直作为自主性基准的国际机器人足球赛事。他将这项运动描述为具身机器所面临的所有难题的浓缩版。 用他的话来说,机器人必须“感知移动中的球,理解其相对于球门的位置,移动整个身体,保持平衡,并精准触球”,而且必须依靠机载传感器和机载计算能力同时完成所有这些任务,比赛中不允许任何工程师触碰机器人。

面对这种压力,顺序处理流程往往会陷入停滞:感知模块上报数据,规划器进行推演,等脚摆动时,球早已移位。 清华团队的解决方案是,不再将视觉和运动视为独立的模块。正如王所言:“我们希望机器人能够通过自身的运动来学习如何对视觉信息做出反应。”一个神经网络负责学习整个闭环过程:搜索球的位置、缩短距离、调整步态、调整身体姿态,最后完成射门。

将盲区训练纳入模拟器

该框架基于三项设计选择。第一项是耦合:感知与控制在单一强化学习目标下进行优化,而非两个系统通过接口进行协商。第二项是对对抗性运动先验的扩展——该技术可确保学习到的动作看起来自然而非抽搐——将其应用到机器人必须根据实时摄像头输入采取行动的情境中。 第三是编码器-解码器记忆机制,它将一秒钟的观察数据(50帧)压缩为一个64维的世界摘要,系统据此重建球的位置及其行进方向,即使防守球员的小腿挡住了视线也不例外。

训练完全在模拟环境中进行,而该模拟器是专门设计来“说谎”的。研究团队将

在虚拟感知系统中的学习过程,该系统会通过检测故障、传感器噪声、延迟、受限的视野以及波动的帧率等手段,有意地干扰机器人所看到的图像。 在这种条件下学习的机器人将不完美的视觉视为常态,而非需要通过备用程序处理的例外情况。已发表的研究结果展示了零样本迁移:策略从模拟环境直接迁移到物理Booster T1机器人上,无需进行硬件调整,且其表现以开篇段落所述的优势幅度超越了基于规则的基线。

用通俗的语言来说,我们可以清楚地看到变化何在。人类前锋不会将计算球的位置、选择移动方案,然后执行射门这三个步骤视为三个可计费的独立阶段。 视觉信息自然融入步态,调整在双腿中完成,甚至在成为有意识的决定之前就已经发生。这就是该控制器所学习的行为,也是为什么当球短暂消失时,机器人能够连贯地恢复,而不是在“软件委员会”重新开会期间陷入僵持。

几乎每件球衣下都藏着一台5,999美元的机器

论文中一个不那么引人注目的故事,其实就印在机器人的球衣上。据Booster自己的统计,在7月举行的RoboCup人形机器人联赛中,59支队伍中有38支采用了其平台,而配备Booster的队伍包揽了所有人形机器人组别的金牌。 王教授本人担任清华大学“火神”队的队长,该队正是凭借同一套硬件,于7月成功卫冕了RoboCup人形机器人组冠军。 一个月后,在北京举办的比赛中,AGIBOT公司的量产机器人包揽了奖牌榜榜首,该公司表示,足球项目中92%的队伍(共计56支)都使用了Booster机器人参赛。

这种高度集中正是其商业模式,

这绝非巧合。Booster 向科研市场推销产品的方式,就像当年仪器制造商推销示波器一样:在每个实验室都配备一个价格实惠、经久耐用且文档完善的平台,这样该生态系统中的人才就会学会按照你的工具链来思考。 该公司推出的 Booster Studio 是一款集成开发环境,专为《Science Robotics》论文所验证的“从仿真到硬件”工作流而设计。如今,每一位在 T1 计算机上训练策略的研究生,明天都将成为指定使用与 Booster 兼容技术栈的招聘经理。学术讲台正是销售漏斗的顶端。

对于关注类人机器人领域的买家而言,这是值得追踪的指标。历史上,研究领域的平台标准化往往先于商业整合,因为软件、数据集和操作习惯都会积累在硬件所在之处。 一家机器占据RoboCup三分之二席位、在北京机器人足球赛中占据九成席位的供应商,目前还算不上是能提供可投入工厂使用的人形机器人的供应商。但它却正处于培养下一千名机器人工程师的前沿阵地。

射门率无法向买家透露的信息

反方观点同样值得重视。与黄昏时的装卸码头相比,足球场地面平坦、光线均匀,由画好的线界定,且受制于比赛中绝不会改变的规则。 在前场位置90%的射门成功率,虽是一项真正的研究里程碑,却是一个毫无意义的采购指标。本文中的任何内容都无法证明该类人形机器人具备拾取托盘、维护机器或与叉车共享通道的能力,作者们也从未声称过这一点。T1是一款研究级平台,而非工业载荷机器人。

真正具有迁移价值的是方法,而非具体技能。赵本人就搭建了这一桥梁:这项运动所强化的能力——“全身协调、视觉感知、快速决策、平衡恢复和反应性动作——对于在日常环境中运作的人形机器人同样重要。”他的第一作者也指出了这一点

该研究指出,感知与动作的耦合延伸至“导航、物体交互和移动操作”。客观而言,这证明了系统在现实中的感官故障情况下仍具备可训练性——该成果发表于经同行评审的期刊,具有可量化的性能余量,且基于任何人都能购买的硬件。最后这一点本身就具有商业价值。 零样本迁移意味着该研究中最昂贵的部分——针对感知失真的训练——是在软件层面完成的;因此,购买同一平台的实验室将直接继承一条从模拟器到实地经过验证的路径,而非需要开展定制化的集成项目。

在类人机器人领域,真正重要的衡量标准已不再是机器人在舞台上行走的速度,而是当其视觉系统失效的几秒钟内,机器人能否做出合理的动作。 未来两年内,负责评估人形机器人供应商的采购团队应借鉴清华大学的测试方案精神:询问系统在遮挡、眩光和丢帧情况下的表现,并确认演示能否在供应商未预先编排的条件下正常运行。一台只接触过纯净输入的机器,就相当于一台从未踏足户外的机器。

研究团队自己的演示视频无需旁白便已说明一切。身穿红色比赛球衣的T1机器人穿越北京一条普通的户外跑道,随着球体的滚动调整步幅,并朝着一个便携式球门踢球——一帧接一帧,在午后随机的光线条件下,画面层层叠加。 没有舞台,没有束缚线,没有重拍。当特技变成工具的那一刻,看起来正是如此平淡无奇,而这一幕登上了《Science Robotics》的封面。

本分析综合了经同行评审的《Science Robotics》期刊论文、研究团队的公开声明以及Booster Robotics公司的披露信息;数据反映了截至2026年9月1日上述来源的信息。

图片来源:清华大学/Booster Robotics研究演示,经自动化促进协会授权发布。

本文

本内容仅供一般参考之用,不构成任何投资、采购、法律或工程方面的建议。
HumanoidRobotsRoboticsChinaPhysicalAIReinforcementLearningRoboCupBoosterRobotics