시메이트(Simate)는 로봇공학 분야에서 “GPT-6를 이겼다”고 주장한다. 그러나 자사가 공개한 순위표에 따르면 그 수치는 27.96%에 불과하다.
창립 3개월 된 한 스타트업이 로봇 공학 벤치마크에서 “GPT-6를 이겼다”고 주장한 내용이 이번 주 검증되지 않은 채로 화제가 되었으나, 해당 벤치마크가 공개한 수치에 따르면 랭킹 1위 모델조차 100% 인간 기준과 비교했을 때 대부분의 실제 조작 과제에서 여전히 실패하는 것으로 나타났다.

지난 3월만 해도 존재하지 않았던 한 기업이 이번 주 로봇 조작 순위표에서 1위를 차지했으며, 가장 빠르게 퍼진 보도에 따르면 이 기업이 “GPT-6-Astra와 DeepMind를 제치고” 세계 1위에 올랐다고 한다. 이 주장에는 어떤 점수도 제시되지 않았다. 날짜도, 순위표 항목도, 다른 자료와 대조해 확인할 방법도 없었다. 그저 그런 주장이 퍼지도록 만들어진 방식대로, 소문은 퍼져 나갔다.
하지만 함께 퍼지지 않은 사실이 하나 있다. 바로 이 회사가 1위를 차지했다는 벤치마크가 자체 수치를 공개하고 있는데, 그 수치에 따르면 이 분야는 아직 걸음마 단계에 불과하다는 것이다. 실제 환경에서 동일한 조작 과제를 수행하는 사람은 100%의 점수를, 시뮬레이션에서는 76%의 점수를 기록한다. 이번 주 리더보드 업데이트 전까지 기록상 최고의 모델이었던 ‘Hy-Embodied-0.5-VLA’라는 오픈 시스템은 시뮬레이션에서 8.8%를 기록했습니다. 암기한 지시가 아닌 낯선 음성 지시를 이해해야 하는 과제에서는, 테스트된 모든 모델 중 최고 점수가 1.67%에 불과했습니다. 이것이 바로 “GPT-6를 이겼다”는 주장이 근거로 삼고 있는 실제 최첨단 기술의 수준이다. 내 주장은 간단하다. 체화형 AI는 초기 언어 모델 리더보드의 신뢰성을 떨어뜨렸던 바로 그 ‘벤치마크 과대광고’ 실패 패턴을, 이 분야의 평가자들이 아직 갈 길이 얼마나 먼지 증명하고 있는 바로 그 순간에 다시 재현해 냈을 뿐이다.
아무도 언급하지 않은 숫자
이 벤치마크는 ‘RoboDojo’라고 불리며, RoboTwin 개발팀이 구축하고 지난 7월 정식 논문으로 발표된 것으로, 세 개의 물리적 로봇 팔을 활용한 42개의 시뮬레이션 과제와 18개의 실제 과제를 다루며, 일반화, 기억력, 정확도, 장기 계획, 개방형 의미 이해라는 다섯 가지 별개의 능력 차원에서 점수가 매겨집니다. 이는 마케팅용 순위표가 아닙니다. 이는 신체 기반 AI에 언어 모델이 이미 갖추고 있는 것, 즉 표준화되고 공개되며 동료 심사를 거친 난이도 곡선을 제공하려는 시도입니다.
이 난이도 곡선은 의도적으로 가혹하게 설계되었으며, 논문에서도 이를 직접적으로 밝히고 있다. 미리 연습된 과제에서는 유능해 보이던 모델들도 지시가 조금만 바뀌어도 무너져 내리며,
로봇이 훈련받지 않은 가정이나 창고에서 작업할 때, 가장 중요한 측면에서 성능 저하가 가장 심각하게 나타납니다. 이러한 격차를 드러내기 위해 만들어진 벤치마크는 점수가 낮게 나올 때 제 역할을 하고 있는 것입니다. 문제는 벤치마크 자체가 아닙니다. 문제는 새로운 수치가 벤치마크에 추가되는 순간 어떤 일이 벌어지는가 하는 점입니다.이번 주 실제로 바뀐 점
9월 23일, Simate-beta라는 새로운 참가자가 33.95점(정규화 기준 27.96%)의 점수를 기록하며 RoboDojo의 시뮬레이션 리더보드에 이름을 올렸습니다. 7월에 공개된 최고 점수인 8.8%와 비교하면 이는 상당한 도약이며, 저는 이 성과를 폄하하지 않도록 주의하고 싶습니다. 해당 모델의 훈련 파이프라인에는 10주 전보다 의미 있게 개선된 부분이 분명히 존재합니다. Simate 자체도 이 개선 사항보다 나이가 조금 더 많을 뿐입니다. 이 회사는 지난 6월, 자율주행 기업 출신 임원, 월드 모델을 연구하는 HKUST 조교수, 그리고 이전에 메타(Meta)에 인수된 물리적 AI 스타트업을 구축하는 데 기여했던 엔지니어가 공동으로 설립했다. 이 회사는 지난 3개월 동안 여러 차례에 걸쳐 이름을 밝히지 않은 투자자들로부터 “수억 위안”(현재 환율 기준으로 수천만 달러)으로만 묘사된 미공개 금액을 조달했다.
이 모든 것이 문제될 것은 없습니다. 실질적인 기술적 성과를 쫓는 빠른 자금 유입은 이 업계가 항상 그래왔던 방식입니다. 독자들이 잠시 멈춰 생각해야 할 점은 바로 다음 사실입니다. 즉, 리더보드 1위를 차지했다는 주장이 독립적인 제3자가 해당 실험을 재현해 보기 전에 이미 대중에게 공개되었다는 점입니다. 이 사안을 다룬 보도 중 비교적 신중한 기사 중 하나는 이를 명료하게 지적하며, 해당 결과가 독립적인 재검증 없이 자체 보고된 것임을 설명하고, 시메이트의 기술 보고서는 추후 공개될 예정이라고 언급했다. 검증되지 않은 27.96%라는 점수가 시장에서 “GPT-6를 능가했다”는 의미로 받아들여지고 있다.
두 리더보드의 이야기
이를 다른 학술 연구팀이 운영하는 경쟁 벤치마크인 ‘로보카사(RoboCasa)’와 비교해 보자. 로보카사는 충분한 기간 동안 운영되어 교훈을 축적해 온 벤치마크다.
RoboDojo는 아직 배울 필요가 없었습니다. RoboCasa의 제출 규칙에 따르면, 비공개 소스 모델의 경우 점수가 게시되기 전에 벤치마크 관리자에게 모델과 코드에 대한 비공개 접근 권한을 부여해야 합니다. 반면 오픈소스 제출물은 코드가 풀 리퀘스트에 그대로 공개되어 있으므로, 공개적으로 검증됩니다. 해당 리더보드에서 현재 세 가지의 검증된 시스템이 과제 세트에서 70~80%의 정답률을 기록하고 있습니다. 월드 모델 애드온과 결합된 GR00T 릴리스 하나가 72.6%, 샤오미가 개발한 정책 모델이 74.5%, 또 다른 시스템이 79.2%를 기록했습니다.이 대조를 잠시 곰곰이 생각해 보십시오. 두 가지 벤치마크, 두 연구 커뮤니티, 그리고 신체화된 AI가 얼마나 발전했는지에 대한 두 가지 서로 다른 그림이 있습니다. 이 차이는 주로 어느 쪽의 로봇이 더 똑똑한지에 대한 문제가 아닙니다. 이는 과제 설계의 문제입니다. 다섯 가지 까다로운 차원과 단 한 번의 잘 연습된 주방 과제 간의 차이이며, 검증 방식의 문제이기도 합니다. 비공개 접근 요건과 여전히 비공식적인 리더보드 업데이트 간의 차이입니다. RoboDojo의 27.96%와 RoboCasa의 79.2%를 비교하여 모델의 상대적 품질에 대해 어떤 결론을 내리는 독자는 진실된 사실을 전혀 파악하지 못한 것입니다. 그 비교는 사과와 오렌지를 비교하는 것이 아닙니다. 심지어 과일조차 아닙니다.
하드웨어의 실제 비용
저는 로봇이 무엇이며 실제로 무엇을 하는지에 대한 분류 체계를 수년간 유지해 온 경험을 바탕으로, 이와 같은 과대광고 주기에 대한 정신적 교정 장치를 갖추고 있습니다. 바로 아무도 마케팅하지 않는 이야기의 부분을 찾아보는 것입니다. 이번 사례에서 그 부분은 바로 팔입니다. 로보도조의 실제 작업은 여러 플랫폼 중에서도 AgileX Robotics의 ‘파이퍼 X(Piper X)’에서 실행되는데, 이 6축 팔은 회사 웹사이트에 배송비 및 세금 별도 1,999달러로 기재되어 있습니다. GPT-6 킬러로 칭송받는 이 모델은, 물리적 형태를 보면 데스크톱 가격대의 팔에 불과하며, 시뮬레이션에서는 10번 중 약 7번, 실제 환경에서는 그보다 더 낮은 성공률로 작업을 수행합니다. 이는 하드웨어를 폄하하려는 말이 아닙니다. 그 가격대에 비해 이 제품은 진정으로 뛰어난 엔지니어링의 산물이기 때문입니다. 이는 독자들이 더 뛰어난 성능을 가진 제품을 연상하도록 유도하는 헤드라인에 대한 정정입니다.
내일 공장으로 행진해 들어가는 인간형 존재에 대해.다음에 볼 만한 것
이 이야기의 솔직한 진실은 “중국이 로봇 공학 분야에서 서구를 뛰어넘었다”는 것이 아닙니다. “진지한 연구자들이 구축한 벤치마크가 설계된 대로 정확히 작동하고 있으며, 그 벤치마크에 새로 등장한 항목 중 하나를 둘러싼 언론의 반응은 리더보드 주장을 둘러싼 언론의 반응이 항상 그렇듯이 똑같이 반복되고 있다”는 것입니다. 평가자들이 검증용 테스트 세트를 구축하고 사람들이 실제로 신뢰하는 제3자 감사를 실시하기 전까지, 나는 언어 모델 분야에서 이 똑같은 패턴이 2년 연속으로 반복되는 것을 지켜보았다. 현재 신체화된 AI는 더 어려운 문제를 다루면서, 더 짧은 기억을 가진 채로 그와 동일한 교훈의 자신들만의 버전을 겪고 있다.
제가 다음에 주목할 점은 Simate의 수치가 유지될지 여부가 아닙니다. 물론 누군가 확인해 주길 바라지만요. 로보도조(RoboDojo)의 관리자들이 다음 번 화제가 될 리더보드 주장이 등장하기 전에 로보카사(RoboCasa)와 같은 비공개 접근 요건을 도입할지, 그리고 그 리더보드 정상에 오를 다음 창업자가 헤드라인이 나오기 전에 기술 보고서를 공개할지, 아니면 그 후에 공개할지가 관건입니다. 이 두 가지 중 하나가 일어나기 전까지는, 이 분야에서 나오는 어떤 ‘GPT-6를 능가했다’는 주장도 정직하게 해석하면 모두 똑같습니다. 즉, 검증되지 않았고, 아직은 아니며, 아마도 겉으로 보이는 것과는 다를 가능성이 높다는 것입니다.
이 칼럼은 2026년 9월 27일 기준 공개된 벤치마크 문서, 기업 성명서 및 학술 논문에 대한 필자의 자체 분석을 반영합니다. 본 내용은 일반적인 정보 제공을 목적으로 하며, 투자, 금융 또는 법률 자문을 구성하지 않습니다.
헤로 이미지: RoboDojo의 실제 평가 과제에 사용된 물리적 플랫폼 중 하나인 AgileX Robotics의 PiPER-X 로봇 팔, 공식 제품 사진. 출처: AgileX Robotics.
