一個名為 stealth/ox-alpha 的未具名模型在程式碼測試中超越 GPT-5.6 與 Claude Fable 5,線索指向智譜(Zhipu)尚未發表的 GLM 旗艦模型。
一個名為 stealth/ox-alpha 的未具名模型在程式碼測試中超越 GPT-5.6 與 Claude Fable 5,線索指向智譜(Zhipu)尚未發表的 GLM 旗艦模型。

一個名為 stealth/ox-alpha 的匿名模型在 DeepSWE 程式碼基準測試中取得 80% 的 Pass@1 成績,擊敗 Claude Fable 5 的 65% 與 GPT-5.6-sol 的 52%,獨立測試結果將其指向智譜(Zhipu)尚未發表的 GLM 旗艦模型。
主導測試的獨立研究員班·戴維斯(Ben Davis)表示,他「99% 確定」該模型屬於智譜 GLM-5.x 系列,依據是相符的影片編碼器行為與分詞器(tokenizer)對齊特徵。
該模型於 8 月 20 日現身 OpenRouter,提供一週免費使用,支援文字、影像與影片輸入,並具備 104.8 萬 token 的上下文視窗。在四組受控影片測試中,ox-alpha 消耗 token 的方式與 GLM-5V-Turbo 完全一致——包括與幀率無關的取樣、每秒約 147 個 token,以及逐幀解析度縮放機制——而小米 MiMo v2.5 與 Qwen 3.8 Max 等競爭候選模型則呈現不同行為。在 25 組提示中,token 計數與 GLM-5.3 完全吻合,僅存在固定 +75 token 的包裝差異。
若經證實為智譜尚未發表的多模態旗艦模型,這將顯示中國實驗室正在縮小與 Anthropic 和 OpenAI 之間的程式碼能力差距,對這些公司享有的估值溢價構成壓力。智譜尚未回應置評請求,免費使用期限至 8 月 27 日截止。
戴維斯從影片編碼器、分詞器、音訊介面與輸出風格等面向追溯模型起源。影片編碼器提供了最強訊號:ox-alpha 與 GLM-5V-Turbo 在所有四組測試集中消耗影片 token 的方式完全一致,而 MiMo v2.5、Qwen 3.8 Max 與 GLM-4.6V 均顯示出不同的編碼特徵。此外,該模型拒絕音訊輸入,與 GLM-5V 一致,而主要競爭候選 MiMo v2.5 則支援音訊。在輸出風格上,ox-alpha 每千字元使用約 1.3 個表情符號,接近 GLM/Qwen 系列,而 Claude、GPT-5.6 與 Grok 在同一環境中表情符號使用率接近於零。
報告也逐一排除了其他來源。DeepSeek 尚未推出影片功能且使用不同的分詞器;Google、Qwen、xAI、OpenAI 與 Anthropic 在分詞器、輸出風格或影片編碼器特徵上均不吻合。智譜有祕密測試的先例——Pony Alpha 後來證實與 GLM-5 相關。僅文字版本的 GLM-5.3 於 8 月 14 日發布,而統一視覺旗艦一直是社群關注的焦點。
在能力方面,ox-alpha 通過了 DeepSWE 十項確定性任務中的八項,包括首次嘗試即通過「meriyah-explicit-resource-declarations」任務——該任務中 GLM-5.3、GPT-5.6-sol 與 Grok 4.6 此前均四戰四敗。它還全數通過 51,469 項回歸測試,並在涵蓋 69 次工具呼叫的代理任務中僅出現一次錯誤且無重試迴圈。戴維斯總結認為,該模型明顯強於 GLM-5.3,暗示這是一個更新的檢查點而非變體。
該模型的解碼速度與 GLM-5V-Turbo 相差約 6%。GLM-5V-Turbo 擁有總計 7,440 億個參數,其中 400 億個為啟用參數,這使戴維斯推測 ox-alpha 採用規模相近的混合專家(Mixture-of-Experts)架構——這將使營運方聲稱的每日 100 兆 token 服務能力更具可信度。樣本規模仍然有限,在重塑競爭格局之前,這些結果需要獨立驗證。
對投資人而言,關鍵在於市場賦予前沿實驗室的溢價。Anthropic 與 OpenAI 相關實體的估值建立在其模型在程式碼與推理能力上領先的假設之上;若中國挑戰者在 DeepSWE 上取得 80% 的通過率並獲得驗證,將縮窄這一優勢。智譜在 OpenRouter 上的祕密測試可能是正式發布前的一次公開預演,過去祕密測試的模型也在免費測試結束後被其實驗室認領。
本文僅供參考,不構成投資建議。