GLM-5.3-Flash首发:开源多模态模型,价格只要Claude的1/40
- 免费干货
- 1小时前
- 4热度
- 0评论

GLM-5.3-Flash(320B-A18B)来了,这是智谱AI GLM-5系列的首个原生多模态模型。
说实话,很多人习惯把前沿智能和前沿价格绑一块儿,总觉得技术牛了就该贵着来。但这次,GLM-5.3-Flash直接打脸这个逻辑。
320B总参数,AA指数57分,和Claude Opus 4.8持平。编程测试里也是同款表现。

价格呢?官方定价是GLM-5.3的很之一,限时折扣直接干到二很之一,对比Opus 4.8更是四很之一。
同样的智力水平,四分之一的价格,前沿智能终于不用省着用了。

正式发布前,这个模型以匿名身份Ox-Alpha在OpenCode和OpenRouter上跑了大规模测试,两周拿下双平台调用量新高。你猜怎么着?这些请求全部由国产芯片撑起来。
极致低成本架构
GLM-5.3-Flash总参数量320B,和GLM-4.5差不多,但激活参数从32B降到18B,层数从92砍到45,近乎腰斩。
配合30T Token多模态预训练语料,性能反而全面超越参数量高一倍的GLM-5.2。
这是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。
线性注意力负责抓局部依赖,稀疏注意力负责召回全局上下文,再加一个IndexPool把索引器4个缓存向量压缩成1个——1M上下文下,延迟和内存开销直接降下来。

对比数据摆在这儿:GLM-5.3-Flash的注意力计算量比GLM-5.3低3.01倍,KV缓存小4.44倍,是所有对比模型里最低的。
技术细节看这篇:https://z.ai/blog/glm-5.3-flash
代码循环里的视觉反馈
GLM-5.3-Flash是GLM-5系列第一个原生支持多模态的模型。
视觉编码这事儿,不只是看图那么简单。它拓展的是编程的边界——前端开发、游戏开发、3D仿真这些活儿,最终产物全是他看得见摸得着的界面或虚拟世界。
模型原生集成视觉能力,能自主判断什么时候该"看",再用视觉反馈指导下一步。
他们把模型丢进Blender里自主跑了16个小时,搭出一套约400平方米的专业主厨自宅加测试厨房,全程没靠任何外部素材。ZCode里的Browser Use Agent和Computer Use Agent,让模型能在代码、浏览器、图形界面之间来回切换,边写边看边改,很多渲染和交互问题只有真正跑起来才能发现……话说回来,这体验确实不一样。
超越Coding的工作伙伴
GLM-5.3-Flash在专业办公场景表现挺能打。
PPTX、PDF、DOCX、XLSX这些格式,模型现在能检查自己的输出,甚至能做审美判断——不是那种"对错"的判断,是"好不好看"的判断。
金融场景:覆盖研究、报告生成、建模分析全流程,所有结论都有可追溯的参考依据。法律场景:合同审查、费用账户责任条款批注、律师函和诉讼文书起草,格式直接对标实务规范。还有文档处理:跨格式审阅、智能排版建议、批量生成这些活都能接。
国产芯片集群扛大旗
过去一周,团队首次在大规模流量里用国产芯片集群提供服务。
单卡算力和内存有限,怎么办?在SGLang基础上搭专用推理引擎,整个构建过程还让GLM-5.3驱动的infra agent加速了。
模型优化系统,系统承载模型,形成正向循环。
内存是主要瓶颈,尤其是1M上下文。技术栈包括W8A8量化、INT8/FP8/BF16混合缓存、Layer Split等一系列激进优化手段。生产级EPD分离架构把多模态编码、prompt预填充、逐token解码拆成独立工作池,互不干扰。
最终效果:端到端性能提升3倍,硬件效率和单token成本追平主流英伟达GPU。
如何体验
GLM-5.3-Flash已正式开源,接入ZCode等平台,API同步开放。
每天限量10,000张体验卡,先到先得。
领取链接:https://bigmodel.cn/activity/trial-card/PU9MTWG0PM
常见问答
GLM-5.3-Flash是什么?
GLM-5.3-Flash是智谱AI推出的首个原生多模态开源模型,总参数320B,AA综合智能指数57分,与Claude Opus 4.8持平,定价仅为Opus 4.8的四很之一。
如何免费获取体验卡?
访问GLM Coding Plan页面领取,每天限量发放10,000张,领取后既可在ZCode等平台使用,也可直接调用API。
GLM-5.3-Flash支持哪些应用场景?
除编程开发外,还支持前端与3D可视化、金融研报生成、法律文书起草审阅等办公场景,兼容PPTX、PDF、DOCX、XLSX等主流格式。