
前沿模型真正进入普惠时代。
据IPO早知道消息,智谱于8月26日上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型。
值得一提的是,GLM-5.3-Flash的总参数320B,能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。在自研Z.ai Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。

与此同时,GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40。同样智力,1/40价格,前沿智能,第一次不需要省着用。

事实上,在正式发布前,智谱以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。而这些请求流量全部由国产芯片提供算力支持。
GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10。这得益于其全新模型架构。GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。结合智谱最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。
GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并采用流形约束超连接提升模型Scaling能力。
需要注意的是,GLM-5.3-Flash在专业工作中的表现相较同级别模型显著提升。针对PPTX、PDF、DOCX和XLSX等Office与文档类任务,新增的视觉理解能力使模型能够检查并优化自身输出,并具备更强的审美判断。模型还可以将自己的输出结果与视觉上下文以及预期的结果进行对比,从而实现更有效的自我验证和优化——包括更准确的呈现质量评估以及审美判断。
此外,智谱专门针对金融、法律等专业工作进行优化——在金融方面,GLM-5.3-Flash可以覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,在整个过程中提供可追溯的参考依据。在法律方面可以审查合同中的费用、账户与责任条款,并按律师惯例批注留痕。它也能起草律师函、合同与诉讼文书,格式与版式符合实务规范,生成即可交付。
过去一周,智谱首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。
为克服单张芯片算力与内存容量相对有限的问题,智谱在SGLang 基础上构建了专用的推理引擎。值得一提的是,整个构建工作由GLM-5.3驱动的infra agent 大大加速,它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。
这些芯片主要瓶颈在于内存容量与带宽,尤其是支持长达1M上下文长度很有挑战。这要求智谱针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。智谱的技术栈结合了用于线性注意力和LM head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化,以及Layer Split等技术。
在集群层面,智谱采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。
与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。
4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有
