重點摘要:
- Qwen3.8-Max 在 Artificial Analysis 的 Agentic Index 中全球排名第一,領先 Claude Opus 5 和 GPT-5.6。
- 這款擁有 2.4 兆參數的模型在 OSWorld-Verified 取得 86.1 分,在 PaperBench 獲得 93.0 分。
- 開源權重將於 8 月 10 日當週釋出,但授權條款仍未公開。
重點摘要:

阿里巴巴的 Qwen3.8-Max 成為首個登上 Artificial Analysis Agentic Index 榜首的中國模型,在 8 月 6 日發布的基準測試中,以全球第一的成績領先 Anthropic 的 Claude Opus 5 和 OpenAI 的 GPT-5.6——這一結果讓這款擁有 2.4 兆參數的模型站上了自主代理競賽的最前沿。
「Qwen3.8-Max 的代理能力領先反映阿里巴巴在訓練該模型時做出了深思熟慮的轉變,將強化學習環境擴展至涵蓋多日工作流程,而非僅限於單一提示詞,」Qwen 團隊在其發布文件中表示。這一排名標誌著中國開源權重模型首次在主要的獨立前沿基準測試中同時領先兩家美國實驗室。
Agentic Index 衡量的是模型執行長期任務的能力——編寫程式碼、操作桌面介面、重現研究成果——而非回答孤立的問題。Qwen3.8-Max 在 OSWorld-Verified 獲得 86.1 分,領先 GPT-5.6 Sol Max 的 83.2 分和 Fable 5 的 85.0 分,並在 PaperBench 獲得 93.0 分,為該比較中的最高紀錄。不過它在核心軟體工程領域落後,Fable 5 在 SWE-Pro 上獲得 80.0 分,而 Qwen 僅獲得 67.7 分。
這一排名對阿里巴巴具有直接的商業意義。8 月 3 日模型全面開放上線當日,其香港上市股價上漲 6.15% 至 124.20 港元。阿里巴巴已在三年內投入 3,800 億元人民幣(約 560 億美元)用於 AI 基礎設施,而阿里雲在 2026 年 3 月季度的營收實現了 38% 的同比增長,其中 AI 相關產品約佔外部雲端銷售的 30%。
Qwen3.8-Max 採用稀疏混合專家架構,總參數達 2.4 兆,但每次推理僅啟用約 950 億個活躍參數——這種設計有效控制了服務成本。阿里巴巴將 API 定價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,遠低於 Claude Opus 5 的 5 美元/25 美元和 GPT-5.6 Sol 的 5 美元/30 美元。對於運行數千個自主代理、每個任務消耗數百萬 token 的企業而言,這一差距會迅速累積。
該模型在中國最接近的競爭對手是 Moonshot AI 的 Kimi K3,後者擁有 2.8 兆參數,並在 Arena.AI 的前端程式設計排行榜上取得第一名,但 Suprmind 的獨立測試發現其在知識檢索任務上的幻覺率高達 51%。阿里巴巴持有 Moonshot 36% 的股權,使其在中國前沿競賽的兩端都有財務曝險。Arena 基準測試平台的共同創辦人、加州大學柏克萊分校教授 Ion Stoica 在 7 月下旬評估,中國開源權重模型與美國前沿實驗室之間的性能差距已縮小至約兩到三個月。
最大的懸而未決問題是授權條款。阿里巴巴表示,Qwen3.8-Max 及較小型的 Qwen3.8-27B 的開源權重將於 8 月 10 日當週在 Hugging Face 和 ModelScope 上發布,但尚未透露授權條款。寬鬆的授權將允許企業自行託管該模型——消除雲端 API 使用所帶來的資料路由曝險——而類似 Moonshot 的 Kimi K3 那樣的限制性客製授權,則會削弱其對長期基礎設施投資的吸引力。
阿里巴巴隨 8 月 3 日全面開放發布的基準測試表格,為 Agentic Index 的排名主張提供了第一個具體依據。但截至發布時,該模型尚未被列入 Artificial Analysis 的主要 Intelligence Index 或 Hugging Face 的 Open LLM Leaderboard,且尚未發布記錄訓練方法或安全評估的完整模型卡。上一代模型 Qwen3.7-Max 在 Artificial Analysis Intelligence Index 中排名第五,得分 56.6,知識檢索任務幻覺率為 22.9%——獨立評估機構尚未確認新模型是否超越了這一基準。
對投資者而言,這一排名強化了這樣一個論點:阿里巴巴的 AI 押注正在以遠低於美國的定價轉化為前沿級別的能力。儘管雲端業務增長強勁,阿里巴巴股價仍相對美國超大規模雲端運算業者存在折價,而如果經獨立重現驗證的代理能力領先地位得以確立,可能支撐進一步的估值重估。風險在於:Agentic Index 如同 Arena.AI 的群眾外包排名一樣,衡量的是人類對提交任務的主觀偏好,而非受控的學術評估。在 Artificial Analysis 或同等機構獨立重跑相同測試之前,這個第一名的排名是一個強烈的信號,而非經驗證的結論。
本文僅供參考,不構成投資建議。