內地科技媒體報道,字節跳動正討論訓練一個參數規模超過5萬億的大語言模型,超過阿里Qwen 3.8-Max的2.4萬億參數,及月之暗面K3的2.8萬億參數,是目前內地已知規模最大的模型。計劃仍處早期階段,最終未必發布。
報道指,字節內部認為與其在現有尺寸上追趕,不如將參數規模一次推至同行數倍,爭取領先位置。字節創辦人張一鳴近日在Seed全體員工大會表態,可接受模型短期內落後於行業,但要以追求智能上限為目標,期望Seed躋身世界第一梯隊。他認可編程(Coding)是當前關鍵方向,但提醒不應完全被牽著走。他反對模型蒸餾路線,認為蒸餾本質是複製其他模型已有能力,難以實現真正超越,應從更底層構建AGI壁壘。
過去半年,Seed多模態模型表現突出,視頻生成模型Seedance2.0及圖片生成模型Seedream一度領先業內,成為火山引擎MaaS業務營收基本盤。但語言模型Seed 2.0市場反響有限,Coding能力明顯落後於智譜GLM-5及月之暗面Kimi系列。張一鳴親自邀請DeepSeek核心研究員郭達雅加入,負責Coding專項訓練。
報道指,火山引擎目前為國內最大模型API賣家,今年收入目標超過400億元,但豆包大模型token消耗增長不及預期,語言模型佔比不高。字節希望以「大力出奇蹟」(Scaling Law)策略,憑藉充足算力儲備及人才隊伍,通過超大參數模型實現彎道超車。