全球大模型聚合平台OpenRouter最新數據顯示,截至8月24日的1星期,之前以"牛來"為代號的智譜開源模型GLM-5.3-Flash,佔據平台19%的Token用量,接近全平台5分之1。模型由商湯支持,全部推理流量均由國產芯片承載,標誌國產算力首次在全球主流大模型服務平台的大規模真實業務場景中,接受高迸發流量檢驗。
智譜於星期三正式開源GLM-5.3-Flash,是GLM-5系列首個原生多模態模型,總參數達3200億,激活參數180億。在全球權威的Artificial Analysis Intelligence Index(AA綜合智能指數)中取得57分,與Anthropic的Claude Opus 4.8持平。模型採用業界首個稀疏注意力與線性注意力混合架構,在保持精準長上下文能力的同時,大幅降低服務成本,定價僅為上一代旗艦GLM-5.2的10分之1。
商湯大裝置為GLM-5.3-Flash提供大規模國產算力支持,通過先進的異構混推技術,讓不同架構的國產芯片各盡其長。智譜披露,相較同一硬件環境下的初始基線,端到端服務性能提升3倍,硬件效率及單Token成本,已達主流輝達GPU相當水平。
商湯表示,旗下「Token工廠」通過整合多元算力及持續優化推理引擎,7月日均Token服務量已達2.42萬億,預計今年底突破日均10萬億。業界認為,此次合作不單驗證國產算力支撐前沿大模型的可行性,更意味國產芯片正從「單點可用」邁向「大規模商用」。