阿里巴巴升級版Qwen3.8-Max以1691分登頂CodeArena前端程式設計排行榜,超越Claude Opus 5與Kimi K3,同時以每百萬Token 5美元的定價佔據該基準測試的性價比前沿。此次更新強化了阿里巴巴在企業級AI推論領域的競爭地位,也反映出中國與西方前沿模型之間的差距正在進一步縮小。
阿里巴巴升級版Qwen3.8-Max以1691分登頂CodeArena前端程式設計排行榜,超越Claude Opus 5與Kimi K3,同時以每百萬Token 5美元的定價佔據該基準測試的性價比前沿。此次更新強化了阿里巴巴在企業級AI推論領域的競爭地位,也反映出中國與西方前沿模型之間的差距正在進一步縮小。

在一項全球網頁開發基準測試中躍升22個百分點,使阿里巴巴的旗艦模型超越了Anthropic與月之暗面(Moonshot AI)的頂級產品,其混合推論價格比大多數西方前沿系統低三倍以上。
9月2日發布的Qwen3.8-Max更新版,在針對程式設計與專業辦公任務進行定向後訓練後,於CodeArena(一個專注前端程式設計能力的第三方排行榜)上達到1691分。該分數使其在全球排名中位居Claude Opus 5與Kimi K3之上。CodeArena更新後的帕累托前沿圖表(以橫軸表示成本、縱軸表示模型能力)顯示,Qwen3.8-Max的混合平均價格為每百萬Token 5美元。
這項基準測試結果延續了中國模型攀升國際排行榜的趨勢。Qwen3.8-Max的前一代產品Qwen3.7-Max在Artificial Analysis Intelligence Index上得分為56.6,不過新版本尚未在該指數上接受獨立評估。在8月中旬Arena的人類盲測排名中,Qwen3.8-Max以1491的ELO位居總榜第8名,為所有中國模型中的最高排名,而Kimi K3 Max排名第12。兩款模型在總榜上僅相差不到兩個ELO點,在統計誤差範圍內實際上並列。
定價差距才是競爭格局最為鮮明的部分。月之暗面的旗艦產品Kimi K3擁有2.8兆參數,每百萬輸出Token收費約100元人民幣——大約是Qwen3.8-Max混合價格的20倍。DeepSeek的V4 Flash以每百萬Token 2元人民幣的價格在兩者之下,但在能力基準測試中得分較低,在AA Intelligence Index上僅錄得50分,而Kimi K3為57分。Qwen3.8-Max在CodeArena帕累托前沿上每百萬Token 5美元的混合價格,使其成為能夠維持頂級基準排名的模型中最佳的性價比選擇。
競爭的利害關係遠不止於基準測試的榮耀。阿里巴巴的Qwen開源模型家族累積了所有中國模型系列中最大的下載量,而CodeArena頂級排名搭配積極的定價策略,可能加速企業採用基於Qwen的模型進行前端開發工作流程。這對阿里巴巴的雲端業務至關重要——隨著中國企業從實驗階段轉向生產環境工作負載,AI模型推論正成為重要的收入驅動力。該公司的雲端部門直接與字節跳動的火山引擎、百度的文心平台以及騰訊的混元大模型爭奪企業級的AI支出。
對西方既有巨頭而言,這個數學問題令人不安。根據已公開的API價格,Anthropic的Claude Opus 5在同等輸出範圍內的溢價定價約為每百萬Token 15至25美元。如果Qwen3.8-Max能以三分之一至五分之一的成本維持其CodeArena領先地位,那麼以前端程式碼生成為優化目標的企業可能難以忽視這一價值主張——尤其是在對價格敏感的亞洲市場,阿里巴巴已透過其雲端網絡在當地享有通路優勢。
這項基準測試結果也為中國AI競爭力的更廣泛論述提供了支撐。中國模型現已佔據CodeArena WebDev排行榜的前兩名,Qwen3.8-Max以1691分領先,Kimi K3緊隨其後。智譜的GLM-5.2也分別在Code Arena和Design Arena的專業程式設計任務中宣稱佔據第一的位置。中國模型在國際程式設計基準測試頂端的聚集——在夏季六週內集中發布的一系列模型所實現——顯示中國與西方前沿模型之間的能力差距在特定領域已縮小至近乎持平。
阿里巴巴的股票在香港交易所和紐約證券交易所雙重上市,今年以來一直是中國股市整體AI漲勢的受益者。Qwen3.8-Max的更新為投資者提供了評估公司AI路線圖的具體數據點,不過該模型對雲端收入的商業貢獻將取決於能否將基準領先優勢轉化為付費的推論流量。阿里巴巴尚未披露Qwen相關的具體收入數字,但伴隨AI需求的回升,其雲端部門在近幾個季度報告了加速增長。
獨立驗證仍是需要注意的事項。Qwen3.8-Max的CodeArena得分來自第三方基準測試,但該模型尚未在AA Intelligence Index上接受評估,而其官方宣稱的基準成績——包括在電子商務模擬測試中4.16倍的回報——均源自阿里巴巴自身。在第三方機構完成評估之前,Qwen3.8-Max相對於Claude Opus 5和Kimi K3在非程式設計領域的完整能力範圍仍是未經證實的。
本文僅供參考,不構成投資建議。