騰訊將LLM與多模態團隊合併為一體,交由姚順宇統領,以縮小與字節跳動和阿里的AI差距。
騰訊將LLM與多模態團隊合併為一體,交由姚順宇統領,以縮小與字節跳動和阿里的AI差距。

騰訊將LLM與多模態團隊合併為一體,交由姚順宇統領,以縮小與字節跳動和阿里的AI差距。
騰訊控股有限公司將其大語言模型與多模態理解部門合併為一個統一的基礎模型部門,將所有核心AI研究交由首席科學家姚順宇統領,以加速模型開發並減少內部摩擦。
一位熟悉此次重組的混元研究員向36氪表示:「此次整合消除了不同團隊從不同角度追求同一目標所產生的重複工作。」姚順宇自今年初接管大語言模型部門以來,一直在對其團隊進行密集審查。
此次重組是姚順宇集中AI資源的一系列動作之一。騰訊今年稍早解散了AI Lab,將所有核心研發人員併入大語言模型部門。該公司還從字節跳動的Seed Infra及後訓練團隊招募人才。前OpenAI研究員、麻省理工學院博士田永龍於7月初加入,負責領導視覺語言模型開發,接替已辭職創業的胡涵。
此次重組之際,騰訊正面臨算力劣勢。該公司2025年資本支出達792億元人民幣(117億美元),而阿里巴巴集團截至2026年3月的財年資本支出為1260億元人民幣。據彭博社報導,字節跳動計劃在2026年投入高達700億美元用於AI基礎設施。在資源較少的情況下,騰訊必須做出取捨——而姚順宇的策略很明確:將人才和算力集中於基礎模型研發。
7月6日,姚順宇展示了其加入騰訊以來的第一項重大成果:Hy3,一款能夠與智譜AI的GLM-5.2及DeepSeek V4 Pro正面競爭的中型模型。此次發布標誌著騰訊在經歷數月的組織動盪後,重返中國AI競賽的第一梯隊。
為什麼多模態理解退居二線
將多模態理解併入更廣泛的基礎模型部門的決定,反映出對回報率的戰略重新評估。據一位接受本地媒體採訪的多模態研究員所述,多模態理解技術——影像識別、影片標題生成——已趨成熟,文字、影像和影片識別的準確率均已超過85%。進一步投資的邊際收益有限。
更困難的問題是視覺推理——讓模型理解影像和影片背後的語義含義——這取決於語言模型推理能力的提升,而非單純的多模態研究。與此同時,多模態理解的商業化路徑仍不明朗。騰訊元寶應用的一位產品經理表示:「沒有用戶願意為影像識別付費,因為市場上有大量免費的替代產品。」用戶願意付費的辦公場景——文檔處理、簡報製作、研究報告生成——依賴的是推理、編碼和智能體能力。
超級工作空間的終局
騰訊內部的整合反映了更廣泛的行業趨勢。據「Beyond the Layout」報導,過去一個月內,騰訊、阿里巴巴和字節跳動均已開始收縮碎片化的AI智能體產品線,並趨向於統一的超級工作空間入口。騰訊將其QClaw產品中心整合到WorkBuddy中,後者被部分人士視為繼QQ和微信之後的潛在第三款重磅產品。阿里巴巴正準備推出「千問辦公」,整合千問生態系統下的三款智能體產品。字節跳動將其AI編碼產品TRAE SOLO更名為TRAE Work,從獨立工具轉向工作流程協作。
這種趨同表明,「千體大戰」正讓位於企業入口的爭奪戰。「Beyond the Layout」評論道:「智能體不會成為下一個微信,但它們極有可能成為新的Windows。」
截至7月下旬,騰訊股價約為預期市盈率的20倍,低於阿里巴巴的22倍,但高於恒生指數的10倍。此次重組若成功,可提升研發效率,並減輕每年超過40億美元的AI支出負擔。然而,由於字節跳動和阿里巴巴在基礎設施上的投入遠超騰訊,混元在建設更大規模基礎模型的算力競賽中仍存在落後風險。姚順宇的Hy3發布顯示了進展,但下一項考驗——騰訊能否在下一個模型週期中維持其地位——將決定此次重組是否真正奏效。
本文僅供資訊參考,不構成投資建議。