RobotAIGeek

機器人技術面臨的不是資料問題,而是介面問題。

Spirit AI 的共同創辦人已將機器人大腦迎來「GPT-3.0 時刻」的期限定為 2027 年年中。 同週,哥倫比亞大學的一個實驗室、現代汽車旗下的 RAI 研究所,以及一支水下機器人團隊,紛紛發表了關於人類應如何操控機器人身體的研究,而非探討機器人應如何自主決策。這項差距,而非融資輪次,才是真正的發展藍圖。

martti
4分鐘閱讀Posted: 2026年9月19日
機器人技術面臨的不是資料問題,而是介面問題。

在 9 月 15 日至 18 日期間,發生了三件必須綜合解讀才能理解的事情。Spirit AI 的共同創辦人向媒體表示,機器人大腦將在 2027 年年中迎來「GPT-3.0 時刻」。 現代汽車的全球研發總監在聖荷西面對一屋子的工程師時,公開承認中國競爭對手的進展「遠比自家公司更快」。此外,由現代汽車旗下研究機構 RAI 研究所打造的雙手機器人,發表了一篇論文,其中最引人注目的成就就是接住了一顆棒球。

這三件事件其實都與機器人的智慧無關。這三者皆關乎在智慧真正發揮作用之前,還必須建構的基礎。

業界不斷談論「數據問題」。本月發表的論文則描述了一項「介面問題」,而這是一個截然不同、更早出現且更難解決的課題。

Spirit AI 實際上透露了什麼

Spirit AI 的提案具體到值得敬重。該公司共同創辦人暨首席科學家高陽(Gao Yang)將機器人大腦稱為「確實是整個機器人技術堆疊中最薄弱的環節」,並為彌合此差距設定了實際的截止期限: 在 2027 年年中達成「GPT-3.0 里程碑」,屆時他預期機器人將能接收開放式的口語指令,並完成未曾接觸過的物理任務。 Spirit AI 自 2024 年 1 月成立以來已募得超過 6.7 億美元,估值逼近 200 億元人民幣(約 29 億美元), 其配備輪子的 Moz1 人形機器人,如今正在寧德時代(CATL)的電池工廠和京東(JD.com)的物流倉庫內進行有組織的輪班作業,而非僅限於實驗室環境。

值得關注的數字並非2027年這個期限,而是Spirit AI在全國範圍內所僱用的約1,000名合約人員,以及300名全職員工,他們負責處理、修正並標註機器人的實體互動數據。 對於已部署的數十台 Moz1 機器人而言,這支人類數據運維團隊的規模,比其機器人車隊還要大一個數量級

支持。高先生自身的論述也承認了這一點:在中國人形機器人的供應鏈中,硬體已趨於商品化,而稀缺的投入資源則是模型所需的標註互動數據——這類數據仍需要人工觀看、修正,並重新錄製機器人幾乎所有嘗試的動作。

這並非對 Spirit AI 的批評,畢竟該公司在這項比例上的坦率程度,遠高於多數競爭對手。這只是關於 2026 年類人型機器人智慧實際來源的事實:並非來自機器人自行進行泛化學習,而是來自一支常駐的人類操作團隊——儘管機器人機隊規模不斷擴大,這支團隊的人數卻未見縮減。

那些沒有人以此為基礎進行融資的論文

正因如此,本月的研究議程才成為更誠實的披露。由馬泰伊·喬卡利(Matei Ciocarlie)領導的哥倫比亞大學實驗室於9月16日發表了《DITTO》——這是一個遙操作介面,而非機器人大腦。 該論文直白地闡明了當前尚未解決的問題:現有的資料蒐集方法迫使人們做出權衡——「遙操作雖能確保部署的一致性,卻缺乏力回饋;而手持式(野外)系統雖能提供自然的力透明度,卻會在部署時造成視覺具身化的落差。」 DITTO 將一隻七自由度的機械手與根據操作者自身手部幾何結構打造的電動外骨骼相結合,旨在收集一種能同時捕捉兩者的數據。

兩天前,隸屬於 RAI 研究所的工程師們發布了 AthenaZero。該研究所是由 Marc Raibert 於 2022 年創立、由現代汽車資助的研究組織,並獲得現代汽車與波士頓動力超過 4 億美元的資金支持。其最引人注目的成就並非自主推理。 而是慣性:這套由22個致動器組成的、與人體質量相當的雙手機械體,透過準直接驅動技術打造,能像人類手臂一樣快速且靈活地移動,其有效質量僅為傳統工業機械手臂的約十分之一。 這台機器人透過玩接球遊戲來展示這項能力。它曾以每小時約69英里的速度投擲球體

每小時——研究團隊表示這是迄今為止由類人型機器人投出的最快球速——從 24 英尺外投出時速高達 41 英里的球,並在 33 次投球中有 27 次成功擊中球棒;這是一項機械上的壯舉,而非認知上的成就,研究人員自己也是如此定位的。

9月18日發表的第三篇論文《ULOHA》,將相同的模式延伸至一個幾乎完全沒有商業資金壓力的機器人學領域:水下操作。 該論文作者指出,雙手模仿學習「主要是在空氣中進行研究」,而他們的貢獻在於開發了專用的「領航者-跟隨者」遙操作硬體,旨在將這種「人環路控制」帶入水下環境。 三篇論文、三個互不相關的實驗室、一個共同的發現:截至本週,已發表的機器人研究前沿,依然在於為人類操作靈巧機器人建立更好的方法,而非讓機器人能夠更自主地運作。

為何遙操作本應是過渡階段,而非終極目標

業界的主流敘事將遙控操作視為「支架」,一種在邁向真正自主化過程中用來收集訓練數據的臨時手段,這與 Figure AI 決定投入超過 10 億美元開發群眾外包數據平台的邏輯如出一轍——該平台迄今已累積 1,600 萬支來自貢獻者的影片。 這種框架假設「支架」本身已是解決的問題,是企業在著手處理其上層更艱鉅的認知層時所部署的工具。

DITTO 自身所闡明的權衡取捨卻顯示出截然不同的觀點。在當前人形機器人融資熱潮持續三年多之後,哥倫比亞大學的一個實驗室仍在發表基礎研究,探討如何從人類手中擷取富含力學資訊的操作數據,同時既不犧牲部署的準確性,也不在數據擷取裝置與部署的機器人之間產生視覺錯位。 這並非一個正在完善現有輔助層的團隊,而是一個仍在定義輔助層應有樣貌的團隊。

預測將迎來「GPT-3.0 時刻」

那種跳過尚未解決的介面問題的預測,並非是預測如何跨越難關,而是直接跳過難關進行預測。

文字之所以能達到那樣的規模,是因為網際網路早已在人類日常溝通中,無意間產生了數兆個語素,而每個語素都採用相同的表示形式。物理互動數據則沒有類似的副產品,也缺乏橫跨機器人機體、感測器組與夾爪的共通表示形式。 每個嚴謹的實驗室仍必須逐步建構能擷取這些數據的工具——無論是一具外骨骼、一套領隨式裝置,還是一條低慣性機械臂——而這項建構工作正公開進行著,且具備時間戳記與可引用性,就在此刻。

這對實際購買者意味著什麼

對於評估人形機器人試點項目的採購團隊而言,這所引發的盡職調查問題,比向供應商索取成功率數據更有參考價值。不妨改問:供應商的訓練數據中有多少比例來自專為其特定硬體打造的遙控操作裝置,而非借用自其他地方的通用資料蒐集工具;以及該裝置最近一次重新設計是在何時。 若某供應商在 2026 年仍在反覆迭代其專屬的資料擷取硬體,這代表其模型仍在追趕一個不斷變動的目標,而非趨近於一個穩定的目標。這並非淘汰的理由。 Spirit AI 自身所提出的 90% 結構化任務成功率數據——該數據是綜合其在 CATL 和 JD.com 部署情況所測得——是真實的、經過量測的表現,而非單純的示範。 但這項數據顯示的進展,相較於2027年截止期限所暗示的,速度更慢、範圍更窄;而那些以該截止期限為基準來定價多年合約的買家,其實是在押注於一個介面層——根據該領域當前的學術發表紀錄,這個介面層目前仍在發明之中。

從這個角度來看,RAI 研究所的棒球機器人,比本月任何一則融資公告都更具參考價值。它清楚地表明,目前最艱難且已解決的問題,是讓機器人的身體像人類一樣活動,

快速、安全且容錯性高。 教導這個機體自行決定該如何行動,是下一個待解難題,而本週發表的論文尚未開始著手解決。這兩者之間的差距,並非邁向 2027 年的過程中微不足道的誤差。這正是實際的路線圖,且必須先在實驗室工作台上驗證,才能進軍工廠生產線。

本分析參考了 Spirit AI、哥倫比亞大學機器人研究人員、RAI 研究所、現代汽車集團及 Figure AI 針對其各自 2026 年 9 月披露內容所發布的公開研究論文、公司聲明及會議發言。本文僅供一般資訊參考,不構成任何投資、財務或採購建議。

首圖來源:RAI 研究所,摘自其關於 AthenaZero 雙手機器人的已發表研究。

RoboticsHumanoidRobotsPhysicalAIResearchTeleoperationSpiritAIHyundai