◎ 科技日报记者 崔爽
8月27日,全球大模型聚合及路由平台OpenRouter公布的最新数据显示,在截至8月24日的一周内,GLM-5.3-Flash占据平台19%的Token用量,接近全平台的五分之一。
GLM-5.3-Flash此前以匿名模型Ox-Alpha上线测试,并迅速成为海外开发者的热门选择。

值得一提的是,据智谱披露,该模型的全部推理流量均由国产芯片承载。
国产算力吃下OpenRouter近五分之一的Token用量,承接起全球主流平台上真实、高并发的业务流量。这不仅是一次面向全球开发者的规模化验证,也意味着国产芯片正进入全球大模型服务链条,在真实市场需求中接受检验。
GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10,这得益于其全新模型架构。
据了解,GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本。
团队还专门针对金融、法律等专业工作进行优化。如在金融方面,GLM-5.3-Flash可以覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,在整个过程中提供可追溯的参考依据;在法律方面可以审查合同中的费用、账户与责任条款,也能起草律师函、合同与诉讼文书等。
目前,GLM-5.3-Flash已正式面向全球开源,接入ZCode等编码平台,并纳入GLM Coding Plan,同步开放API调用。



客服