Google DeepMind 的新型機器人 AI 系列賦予人形機器人即時推理、規劃與協作的能力——這是該實驗室邁向「物理 AGI」的又一里程碑。
Google DeepMind 的新型機器人 AI 系列賦予人形機器人即時推理、規劃與協作的能力——這是該實驗室邁向「物理 AGI」的又一里程碑。

Google DeepMind 發布了一套由三個模型組成的機器人 AI 系列,使人形機器人能夠在推理任務的同時協調全身動作,讓機器在物理環境中更接近人類等級的靈巧度。
「這是我們邁向所謂『物理 AGI』(Physical AGI)道路上的又一個里程碑,這意味著我們能讓機器人做到人類能做的任何事,」Google DeepMind 機器人部門負責人 Carolina Parada 向《WIRED》表示。
旗艦模型 Gemini Robotics 2 能從腳趾到指尖完全控制人形機器人,而 Gemini Robotics ER 2 則負責透過即時視訊串流進行高層級規劃,具備 12.8 萬個 token 的上下文視窗。第三個模型 On-Device 2 於本機端運作,可在數小時內從不到 200 個範例中適應新的雙臂機器人。在測試中,配備 Inspire 靈巧手的 Apptronik Apollo 2 從貨架上取物的成功率為 76.3%,從桌面上取物的成功率為 68.4%。配備 22 自由度 SharpaWave 靈巧手的五指操作則更具挑戰性:擰下燈泡的成功率為 92%,但擰入燈泡僅為 36%,紮垃圾袋則為 44%。
此次發布使 Google 得以在物理 AI 市場中爭奪市佔率,未來機器人可能承擔倉儲分揀、設施檢查和實驗室任務。Google DeepMind 執行長 Demis Hassabis 曾表示,他希望打造一個類似 Android 之於智慧型手機的機器人 AI 作業系統——這一願景將使 Google 在任何製造硬體的公司中獲得平台層級的影響力。
ER 2 帶來連續視訊推理能力
基於 Gemini 3.5 Flash 的 ER 2 模型處理即時視訊而非靜態影像,使其能夠判斷任務是否完成——這一能力長期限制了機器人的自主性。該模型將進度分類為五個完成區間,準確率為 57.4%,並能精確定位關鍵時刻(例如杯子何時已滿足以停止倒水),準確率達 91.3%,平均誤差為 0.96 秒。該模型透過 Gemini Live API 的雙向端點進行串流,將推理延遲保持在足以進行物理控制的低水準。
ER 2 還能實現多機器人協作。在示範中,Apollo 2 與 Franka Duo 雙臂平台協同作業,共享對任務的語義理解,並在機器之間交接工作。另一場示範展示了 ER 2 驅動 Boston Dynamics 的 Spot 上的導航與操作 API,透過語音指令取物。
安全護欄與部署邊界
Google 推出了 ASIMOV-Agentic,這是一個衡量推理模型在擔任指揮角色時是否安全運作的基準——包括拒絕不安全的工具呼叫、判斷物理可行性,以及在不確定時請求人類協助。當有人靠近時,ER 2 會讓機器人停下,並在區域清空後恢復作業,這是協作安全標準中的一項要求,通常透過硬體而非規劃模型來實現。
模型卡明確禁止開發者將機器人模型用於安全關鍵任務,特別點名醫療保健和交通運輸領域。這意味著第一波部署將導向檢查、倉儲處理和實驗室任務——這些環境中發生故障的風險較低。
競爭格局與人才流動
儘管 Anthropic 和 OpenAI 在聊天機器人和程式編寫工具方面處於領先地位,但 Google 在機器人研究方面擁有更紮實的成績,此前曾與 Boston Dynamics 合作為四足機器人提供 AI 能力。此次進軍機器人領域之際,DeepMind 正解散其獲得諾貝爾獎的 AlphaFold 團隊,將大多數原始作者重新指派至 Gemini 專案。與 Hassabis 共同獲得 2024 年諾貝爾獎的 John Jumper 於六月離開公司加入 Anthropic,隨行的還有兩位 AlphaFold 核心研究員。
Alphabet 股價目前約為預期本益比的 22 倍。這些機器人模型短期內不太可能產生可觀營收,但它們鞏固了 Google 在物理 AI 競賽中的地位——這是一個可能重塑物流、製造和醫療保健領域自動化支出的市場。如果 Google 的機器人作業系統願景成功,該公司將對每一台售出的人形機器人收取平台稅,類似於 Android 在智慧型手機領域的商業模式。
本文僅供資訊參考,不構成投資建議。