Simate 成立三个月后便登顶 RoboDojo 排行榜
成立仅三个月的北京初创公司Simate,凭借一款通过人工智能驱动的自动化研究流程(而非仅靠人类工程师)开发的模型,在RoboDojo机器人操作基准测试中名列榜首。

一家成立仅三个月的北京初创公司Simate在RoboDojo(一个广受关注的通用机器人操作基准测试平台)上取得了最高分。据其创始人称,该模型主要由其他人工智能系统设计,而非仅由人类研究人员独立完成。 Simate-beta在RoboDojo上的平均得分为33.95,任务成功率达27.96%,在排行榜上领先于所有其他参赛者,且未针对该基准测试进行任何特定任务的调优。
Simate由张颖领导,他曾是自动驾驶系统的核心技术负责人,他将公司的核心方法描述为“物理AI的AI”:利用自动化研究系统来设计、测试和优化机器人智能模型,其速度远超人类工程团队单独完成的速度。 自三个月前成立以来,该公司已完成多轮融资,每轮估值均达数亿元人民币,这一融资速度反映出,即便在企业生命周期的最初阶段——即尚未经过充分验证的阶段——中国资本对物理AI研究的追捧程度之高。
Simate总部位于北京,专注于通常被称为“物理AI”或“具身AI”领域的最早期阶段:构建基础模型,使机器人能够在物理世界中感知和行动,这与主导文本和图像生成领域的大规模语言模型截然不同。 其核心产品“Sipai”是一套操作模型家族,其中包括运行在该公司称为“Sinfra”的基础设施层上的“Simate-beta”;而“RoboDojo”的成果则是首个公开证据,证明该方法已足够成熟,足以与资金更雄厚的实验室一较高下。
旨在超越人类团队迭代速度的自动化研究流程
Simate 与大多数模型发布成果的区别,不仅在于基准测试分数本身,更在于该公司所称的产生该分数的过程。Simate 构建了三个相互关联的系统:SiPAI 是一个模块化框架,它使模型架构不仅对人类,而且对自动化分析也变得易于理解
由谁编写的;AutoResearch——一个从论文、代码仓库、先前的实验和内部数据中提取实时上下文的系统,使人工智能代理能够提出并执行其自身的模型调整; 以及一个原生AI基础设施层,该层会在并行模拟中执行大量候选实验,随后将表现最优的候选方案推广至真实环境的机器人测试中——这种弥合“模拟到现实”差距的方法,与RobotAIGeek在报道SimFoundry训练数据自动化时所描述的自动化数据管道相类似。实际上,这意味着 AutoResearch 中的 AI 代理可以修改模型架构、调整训练配置、启动实验、根据目标指标评估结果,并决定下一步尝试什么,而人类研究人员只需设定战略方向,而非手动编写每个实验。 Simate将此定义为“物理RSI”(Physical RSI)的连续谱——即应用于机器人领域的递归自我改进,其范围从“弱形式”(AI协助执行常规实验)到“强形式”(AI驱动的迭代处理大部分研究循环,而人类仍掌控应追求哪些能力以及何时将结果视为足够可靠以投入应用)。
该公司现正向外部研究人员开放 AutoResearch,参与者包括来自麻省理工学院、加州理工学院、清华大学和北京大学的学者,将最初作为内部工具的系统转变为共享的研究平台。 这一举措在商业上与在科学上同样重要:如果外部实验室将AutoResearch作为自己的实验层,Simate的自动化研究方法就将成为行业标杆,而不仅仅是一家公司的内部主张——正如早期的开源模型训练框架塑造了整整一代AI实验室的工作组织方式一样。
Simate-beta 的真正独特之处
该模型
该模型本身围绕着公司所称的“四维物理感知”和“分层时序记忆”这两项能力构建而成。 前者旨在让模型具备对物理属性的实际感知能力,例如物体的重量、摩擦力和重心,而不是将场景视为需要进行模式匹配的平面图像。后者则旨在让模型在执行漫长且多步骤的任务时能够保持上下文记忆,而不是将每个动作都视为从空白状态开始。公开演示中,一条搭载 Simate-beta 的机械臂完成了泡茶等任务——这一操作序列要求机器人记住哪些步骤已完成,在拾取不同容器和器具时调整抓握方式和施力,并在中间步骤未按计划进行时实现干净利落的恢复。 这些恰恰是通用操作模型历来难以攻克的领域:行业内常见的只是单一技能的简短演示,而能够在长任务序列中保持稳定,并能从微小错误中进行现实恢复的模型依然罕见。 RoboDojo的构建初衷正是为了区分这两类主张:它将记忆力、精准度、长时效执行能力和泛化能力作为独立的能力维度进行评分,而非仅以单一的任务完成总分作为衡量标准。这也正是为何在该平台上取得领先成绩,其分量要比在范围更窄、仅测试单一技能的基准测试中夺冠更为重要。
Simate-beta与其他榜单模型之间的差距足够显著,绝非微乎其微。在Simate入榜前的两周内,榜单模拟赛道上的最高得分来自LiberAI贡献的Liber-0 Preview, 其平均得分为30.74,成功率为25.52%;以及榜单上被称为GPT-6-Astra的参赛作品,平均得分为28.97,成功率为22.48%。 另外两个近期参赛者——DeepSeek-Flash 和一个名为 GPT-5.5 的模型——在该排行榜更严格的评估设置下,得分均低于 3.0,成功率也不到 1%,这说明了……
一旦模型超出其训练分布范围,性能就会急剧下降。 Simate-beta 分别取得的 33.95% 和 27.96% 的成绩,在平均分指标上比排名第二的模型高出约 3 个百分点;据该公司称,这一成绩是在未针对 RoboDojo 任务集对模型进行专门调优的情况下取得的。模型背后的自动驾驶人才迁移
张英的背景是这个故事中结构上更引人入胜的部分。自动驾驶培养了一整代工程师,他们花费数年时间解决的问题与具身人工智能高度契合:在传感器噪声下的实时感知、在不确定性条件下的规划,以及构建必须在实验室之外(而非仅在演示环境中)可靠运行的系统。 据描述,张英的团队历经三代架构演进——从基于地图、到无地图,再到端到端学习——构建了一个可与特斯拉全自动驾驶系统媲美的驾驶技术栈,这使团队积累了恰恰是AutoResearch目前正试图实现自动化的那种迭代式、数据驱动的模型开发经验。
Simate的其他核心招聘也印证了这一趋势。 香港科技大学助理教授詹方能(其领导的实验室专注于世界模型研究),以及曾任职于Meta收购的一家专注于类人机器人控制的物理人工智能初创公司的研究员吉马泽宇,两人都是从相邻的研究领域转入通用操作领域,而非从该领域起步。 这种人才流动并非Simate独有。随着自动驾驶投资周期日趋成熟并放缓,而大量新资本正涌入具身人工智能领域,一批资深工程师正持续从自动驾驶公司转向类人机器人和操作机器人领域,带来了纯机器人研究团队往往缺乏的生产工程专业素养。这一转变在
RobotAIGeek对“世界模型时代”经济状况的分析,这对希望将Simate置于更广泛的浪潮之中、而非视为孤立事件的读者来说,是一个有用的参考依据。为何应对成立仅三个月便登顶排行榜的成绩持谨慎态度
在成立仅三个月后便取得 RoboDojo 得分,这确实是一个非常快的成绩,但同时也属于早期阶段。 在变化迅速的基准测试中,排行榜上的成绩往往会在数周内被超越——因为竞争对手会针对同一套测试用例调整自己的模型。而且,基准测试的胜利并不能直接说明该模型能否可靠地部署在付费客户的工厂车间或家庭环境中,因为在这些场景中,光照、 杂物和物体种类远比基准测试中标准化的任务集难以控制。Simate尚未披露任何商业部署、付费客户或量产时间表;该公告更多是作为研究和招聘的里程碑,而非商业成就。
值得关注的更具持久意义的论点并非这一具体分数,而是AutoResearch是否能真正实现复合增长。 如果借助 AI 辅助的迭代,Simate 能够每隔几个月就推出显著改进的模型,而不是像基础模型开发那样通常需要数年周期,那么该公司的优势将来自研究速度,而非任何单一的架构理念,而这种优势往往更难被竞争对手迅速复制。 反之,如果自动化管道在耗尽简单优化空间后产生边际效益递减,仅凭先发优势的基准分数,该公司将难以在与资金雄厚得多、且已开始构建自有自动化研究工具的实验室的竞争中立足。该公司承诺在年底前发布的论文和开源贡献,将成为检验哪种模式正在演进的首个真正考验。
对于采购团队而言,
对于那些关注嵌入式人工智能市场而非参与其研发竞赛的自动化采购方而言,实际的启示是保持耐心而非急于求成。一家在基准测试中名列前茅、却未披露客户、未公布安全验证结果且没有制造合作伙伴的企业,只是一个值得关注的信号,尚不属于应纳入候选名单的供应商。 三到六个月后值得重新审视的一个更有价值的问题是:Simate能否将研究速度转化为系统集成商能够实际授权并部署的模型?因为从排行榜成绩到可支持的商业产品之间存在这一鸿沟,而过去两年中,大多数快速崛起的实体人工智能初创企业正是在此处陷入停滞。本分析综合了截至2026年9月27日关于Simate的RoboDojo成果的公司声明、技术演示及公开报道。本文仅供一般信息参考,不构成投资或专业建议。
封面图片来源:Simate。











