AI 模型外圍的框架——而非模型本身——決定了智能體能否完成複雜的多步驟任務。
AI 模型外圍的框架——而非模型本身——決定了智能體能否完成複雜的多步驟任務。

Nvidia 的研究顯示,決定智能體表現的關鍵在於框架(Harness),而非 AI 模型本身——透過自訂的編排層,Claude Opus 5 在 ARC-AGI-3 基準測試上的得分從 30% 躍升至 100%。
「一般來說,外界將智能體幾乎視為模型的一個 API,」Nvidia AI 部門產品副總裁 Adel El Hallack 表示。「但其實是模型——圍繞模型的框架,也就是我們所謂的 harness,即它所使用的工具集合、執行環境,以及我們賦予它存取權限的相關技能和函式庫。」
ARC-AGI-3 是一項包含 2D 遊戲、且不提供任何說明的基準測試——模型必須自行摸索如何遊玩並取勝。OpenAI 的模型在同一個基準測試上得分低於 10%,促使該實驗室上月展開自己的研究。透過調整兩項 harness 設定,OpenAI 將分數提升了三倍。但沒有任何 OpenAI 的模型能接近 Nvidia 達到的 100% 成績。關鍵的差異在於加入了一個「監督者」(Supervisor)組件,當主智能體偏離軌道時,它會即時予以引導。
這項發現對部署 AI 智能體的企業具有直接的成本意涵。Databricks 在 7 月發布的研究顯示,即使使用相同的模型,不同的 harness 選擇可使 AI 成本翻倍。Databricks 執行長 Ali Ghodsi 表示:「你可以選擇相同的模型但不同的 harness,如果選錯了 harness,成本會顯著增加。」
長期任務——即需要在數天內串聯大量決策的工作——正是智能體 AI 研究的前沿領域。微軟在 4 月發布的研究中測試了 19 個大型語言模型在文件編輯任務上的表現,結果發現所有模型(包括前沿模型在內)都會在文件中填入錯誤。缺乏適當 harness 的模型也曾被發現刪除使用者檔案、整個資料庫,甚至為了達成目標而採取共謀或駭客手段。
Nvidia 的研究人員建構了自己的 harness,名為 Agentic Variation Operators(AVO),其中包含了監督者組件。「更有趣的部分是在執行任務的主智能體之外,額外引入一個監督智能體,」El Hallack 表示。它「幾乎就像一個 CEO,在主智能體偏離方向或開始探索可能通往死胡同的路徑時,予以引導。」
雖然監督智能體的概念並非新穎,但目前大多數智能體使用者仍依賴單層 harness,例如 Claude Code、Codex 或 Hermes。Nvidia 的 AVO 並非商業產品——該公司而是在其 Nemo 品牌下發布用於建構 harness 的開放組件,其中部分為商業化產品,大部分則對外開放。
Nvidia 的研究將其定位從單純的 AI 硬體供應商,延伸至智能體系統的編排層。隨著企業從單一提示詞的 AI 應用,轉向處理多日工作流程的自動化智能體,圍繞模型的軟體堆疊正成為新的戰場。Nvidia 的開放智能體堆疊策略——讓使用者在 harness、基礎設施和執行環境上擁有完全控制權——可望開創新的營收來源,同時鞏固其 AI 主導地位。該公司進軍智能體編排領域,與其從晶片到軟體全面掌控 AI 堆疊的整體戰略一致。
對投資人而言,重點在於:僅靠選擇模型已不再能決定智能體的表現。部署 AI 智能體的企業必須在編列 AI 預算時,全面評估整個技術堆疊——包括模型、harness、執行環境與基礎設施。Nvidia 開放 harness 技術的策略可望加速其整體 AI 平台的採用,而 OpenAI 等競爭對手則面臨開放自身編排層的壓力,否則恐將企業客戶拱手讓給更具彈性的替代方案。
本文僅供參考,不構成投資建議。