十万张国产卡扛起牛来 国产算力第一次在全球真实流量里接受压力测试
智谱GLM 5.3 Flash的发布真正引发产业链震动的,并不是3200亿参数,也不仅是第三方评测达到57分,而是模型背后的算力来源。智谱确认,GLM 5.3 Flash正式上线后的全部线上流量由约10万张国产芯片承载,此前以Ox Alpha身份在OpenRouter和OpenCode进行匿名测试时,相关请求同样全部运行在国产算力之上。公开报道显示,测试期间Token调用量达到62万亿。对于长期围绕国产AI芯片展开的资本市场而言,这意味着讨论正在第一次大规模从纸面参数和实验室Benchmark转向全球开发者真实调用。
SemiAnalysis随后给出的评价进一步放大了这一事件的产业意义。该机构称,Ox Alpha对应的算力供给一度达到每天约100万亿Token,而且相关流量全部由中国芯片处理,其观察到的硬件效率和单位Token成本已经可以与英伟达GPU进行比较,并认为CUDA护城河再次面临测试。这里需要区分不同数据口径。智谱及国内报道披露的是测试阶段62万亿Token等实际调用数据,SemiAnalysis讨论的则是每天100万亿Token级别的服务能力,两者不能简单等同。但对于产业判断而言,真正关键的是同一点,大规模国产集群已经开始承接海外开发者无法预先挑选负载的线上流量。
过去衡量国产AI芯片,市场经常围绕峰值算力、显存带宽和单卡性能与英伟达比较,但大模型推理真正考验的是完整系统。十万卡规模意味着芯片只是起点,驱动、编译器、算子库、通信网络、故障恢复、任务调度以及模型本身的软硬件协同都会影响最终Token产出。一颗芯片理论性能达到海外产品的多少,并不能直接推导出一套万卡集群可以稳定提供多少有效算力。Ox Alpha的特殊之处就在这里。开发者事先不知道模型身份,也不知道背后使用什么芯片,调用是否持续主要取决于速度、稳定性、能力和价格,因此这种测试比单纯的跑分更接近真实商业环境。
但这并不意味着国产芯片已经在单卡性能上追平英伟达。GLM 5.3 Flash本身就是一款高度面向推理效率优化的模型,总参数3200亿但每次仅激活180亿参数,同时引入稀疏注意力和线性注意力等机制。智谱披露,其注意力计算量较GLM 5.3下降约三倍,KV缓存缩小约4.4倍。换句话说,能够在国产卡上以较低成本输出大量Token,既来自硬件和软件栈进步,也来自模型架构主动降低计算需求。把全部功劳归因于芯片,或者由此判断国产GPU已经全面达到英伟达同代产品水平,都属于过度推演。
真正值得英伟达关注的是另一件事。CUDA长期最强的地方并不是一张GPU的理论性能,而是开发者、软件工具、算子库和应用程序形成的生态锁定。英伟达管理层过去也多次强调,安装基础、可编程性以及跨云部署能力共同构成其竞争优势。当越来越多中国模型从训练阶段开始围绕国产硬件优化,并通过开源向全球传播时,模型与硬件之间的关系可能发生变化。过去是全球模型首先针对CUDA优化,然后其他芯片努力兼容这些模型。未来如果一批使用量足够大的开源模型原生运行在国产算力之上,软件生态就有可能反过来围绕新的硬件栈生长。这才是SemiAnalysis所说CUDA护城河再次接受测试的核心含义。
对于资本市场而言,10万张国产卡的意义因此不能简单理解成又一轮国产替代行情。过去市场购买的是缺少英伟达之后必须使用国产芯片的逻辑,现在开始增加另一层定价,即国产芯片能否主动承载具备国际竞争力的模型,并以有竞争力的Token成本服务全球用户。一旦第二条路径成立,国产GPU的潜在市场就从国内供应链安全扩大到全球AI推理市场。不过下一阶段仍需要观察几个硬指标,包括国产集群持续运行的稳定性、单位Token总成本、软件迁移成本、芯片实际供货规模以及客户是否愿意长期付费。十万卡真实负载不是CUDA护城河消失的证明,却是国产算力第一次把挑战从概念层面推进到了规模化商业系统层面。