关键词: 智谱 GLM-5.3-Flash 开源 国产芯片 牛来
8月26日晚间,"国产大模型第一股"智谱在官方公众号发文,正式官宣上线并开源GLM-5.3-Flash(320B-A18B)。这款大模型正是过去一周在海外开发者社区刷屏的神秘匿名模型Ox-Alpha——中文社区给它起了个外号:"牛来"。

至此,这场持续近一周的"身份猜谜"尘埃落定。而比模型本身更受业界关注的,是支撑其运行的算力底座:智谱披露,"牛来"测试期间的全部线上流量,以及GLM-5.3-Flash发布后的线上服务,均由10万张国产芯片承载。这是国产算力芯片首次大规模直接服务全球真实负载。

故事要从8月20日说起。当晚,全球最大AI模型聚合平台OpenRouter的模型目录里悄然多出一个条目:stealth/ox-alpha。没有公司名,没有参数规模,价格栏写着两个零——免费。

Ox意为"牛",恰逢电影《牛来》走红,中文开发者社区便给它起了"牛来大模型"的昵称。
上线首日,Ox Alpha调用量即登顶OpenRouter并刷新单日模型用量历史纪录。据科创板日报报道,在OpenRouter上,Ox Alpha过去7天的调用量达到23.2T,排名第一,较第二名的DeepSeek-V4-Flash正式版高出一倍有余。在OpenCode平台,它终结了DeepSeek连续56天的榜首纪录,连续6天调用量排名第一,累计调用量44T,单日处理tokens达62T。
OpenCode官方公告称,该模型背后提供方每天拥有100万亿tokens的算力供给。这曾引发社区热议:每天100万亿Token的算力从何而来?如今答案揭晓——10万张国产芯片。
在智谱官宣之前,全球开发者已展开了一场"技术指纹侦探战"。
独立研究员Ben Davis通过五重技术指纹分析,给出约99%的概率认定Ox Alpha属于智谱GLM-5.x系列:25组提示词分词器测试与GLM-5.3逐字吻合;视频编码器token消耗与GLM-5V-Turbo完全一致;音频拒绝行为与GLM-5V一致;每千字符约1.3个emoji的行为风格与GLM/Qwen系匹配;服务器返回的Java堆栈暴露内部类路径与智谱Z.ai公开API结构完全对应。
"匿名上线、全网实测、择日揭晓"的打法,让GLM-5.3-Flash在揭晓前已完成真实流量压测并收割盲测口碑。北京计算机学会AI专委会秘书长、北京大学特聘研究员张有鱼评价,这种策略"在DeepSeek V4 Flash提价、市场对'用得起的前沿模型'呼声日高的背景下,以'前沿能力+1/40价格+国产算力底座'的组合切入,前沿模型的价格底线被再度击穿。"
据智谱官方披露,GLM-5.3-Flash是GLM-5系列首个原生多模态模型,总参数320B,激活参数仅18B,拥有百万token上下文窗口,采用MIT协议面向全球开源,已上线Hugging Face。
在能力层面,该模型在Artificial Analysis Intelligence Index中拿下57分,与Anthropic旗下最受欢迎的Claude Opus 4.8持平,高于上一代旗舰GLM-5.2的53分和DeepSeek V4 Pro正式版的53分。在自研ZCode Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。
在架构层面,GLM-5.3-Flash是GLM系列首次引入稀疏注意力与线性注意力混合架构,并创新采用流形约束超连接(mHC)。据智谱披露,该架构使注意力计算量较GLM-5.3下降约3倍,KV缓存缩小4.4倍,支撑1M上下文窗口的经济化部署。总参数量与GLM-4.5相当,但激活参数量与层数几乎减半。

在价格层面,GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣期内低至1/20,仅为Opus 4.8的1/40。具体调用价格为每百万token输入0.8元、输出2.8元、缓存命中0.23元。

此次发布最具标志意义的,是算力底座的国产化。
智谱方面明确表示,"过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。"据科创板日报从相关人士处获悉,上述国产算力芯片或来自华为、海光、摩尔线程。

图自:智谱创始人唐杰X账号
在集群架构层面,智谱采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池。
智谱称,与同一硬件上的初始基线相比,端到端服务性能提升了3倍,"硬件效率和单Token成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。"

半导体研究机构SemiAnalysis随即在X平台发文评论:“所有流量均由国产芯片承载,硬件效率和单token成本已可与英伟达GPU相媲美。继Jalapeño(OpenAI自研推理芯片)昨日宣布之后,CUDA护城河再度受到考验。”
这并非智谱第一次以匿名形式发布新模型。今年2月,OpenRouter上出现的Pony Alpha最终被证实为智谱GLM-5,揭晓后智谱股价两日暴涨60%。中文社区因此戏称"牛(Ox)马(Pony)配齐了"。

8月27日,智谱(02513)股价盘中涨超8%,截至发稿上涨6.99%,报1102港元,成交额22.86亿港元。
目前,GLM-5.3-Flash已接入ZCode等编码平台,并纳入GLM Coding Plan(每天限量发放10,000张体验卡),同步开放API调用。智谱方面表示,该模型基于30T Token多模态语料完成预训练,擅长处理Coding与Agent任务。有博主测试发现,用同样的Prompt让"牛来"生成SpaceX Raptor猛禽发动机3D交互网页,数日后输出效果竟能持续自我改进,"似乎是一个能自己持续学习的模型"。
SemiAnalysis在评论中特别指出,此前有观点认为只有顶级前沿实验室才具备每日100万亿token的算力规模,“而这里每日100万亿token的免费流量,全部跑在国产芯片上。”

来源:电子工程专辑