GLM-5.3-Flash来了:神秘Ox Alpha揭开真身,价格比DeepSeek便宜一半
- 免费干货
- 1小时前
- 4热度
- 0评论
昨晚(8月26日),智谱突然放出了 GLM-5.3-Flash。

如果你关注过那个在多个平台上引发讨论的匿名模型 Ox Alpha,那么这次基本可以确认:它的真身,就是 GLM-5.3-Flash。
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,把视觉理解塞进了 Coding 和 Agent 的工作循环里,同时价格压到了很激进的位置。
Ox Alpha 终于有了正式名字
说实话,在正式发布前,Ox Alpha 可是顶着个匿名模型的身份跑了挺久测试,不少开发者都体验过……
你发现没,它给人的感觉压根不像是在「聊天」,而是实打实干活的——写代码、调工具、搞复杂任务,搞砸了还会自己调整,对吧?
话说回来,当时就有人扒出这可能是智谱在跑的新模型,现在看来确实如此。
不过我得先提一嘴,模型在不同平台、不同推理配置下的表现确实会有差异,这点你们心里得有数。
我把 Ox Alpha 直接理解成 GLM-5.3-Flash 的匿名测试阶段,更准确地说——它们就是一回事,同一次能力升级而已。
它到底升级了什么?
说实话,智谱这次公布的基础参数……还挺有意思的:
- 总参数量:320B
- 激活参数量:18B
- 上下文窗口:1M
- 最大输出:128K
- 输入模态:文本、图片、视频、文件
- 输出模态:文本
- 模型代码:
glm-5.3-flash
我觉得最值得关注的,是它的架构换了。

相比 GLM-5.3,注意力计算量直接砍了大约 3 倍,KV Cache 也小了将近 4.5 倍——这数字看着挺猛,对吧?
这意味着什么?
你平时随便聊聊可能感觉不到区别。但如果你要处理很长的代码库、翻一堆文档、或者跑那种多轮的 Agent 任务……推理成本、响应速度、还有能扛多久不崩,这些才是关键。
老实讲,它不像是在卷"这道题能不能答满分",更像是在拼命把自己打造成能让你长时间依赖的工作伙伴。
原生多模态,不只是能识图
说实话,现在支持图片输入的模型真不少,但 GLM-5.3-Flash 有意思的地方在于——它想让视觉能力真正参与到任务执行里,而不只是「看个图」就完事了。
举个例子:
- 直接读网页截图,布局、组件、交互关系全给你摸清楚;
- 根据截图直接生成前端代码;
- 页面跑起来,看真实渲染效果;
- 再拿参考图一对比,错位在哪、溢出有没有、颜色间距对不对,一眼看出来;
- 改完代码?没问题,再来一轮检查。
智谱管这叫「视觉 Coding」。
我以前也用过不少 Coding Agent,老实讲,它们大多只能看代码和终端日志。但你想想,前端页面、游戏、3D 场景这些玩意儿,最后不都得靠眼睛验收对吧?
代码没报错,页面就能好看吗?我倒是认为未必。
```html
Coding 之外,它还想做什么?
1. 前端与浏览器操作
说实话,它的能力远不止写代码。你扔给它一张截图、一段录屏,或者随便一个网页链接,它都能试着还原出能跑的前端项目。
最让我觉得有意思的是,它能在写代码、开浏览器看效果、自己上手点一点之间来回切换。发现问题再改回去,观察→实现→试用→修正,这一套下来基本就是一个完整闭环。
2. Office 成品交付
话说回来,它在 Office 这块也下了一番功夫。
不只是帮你填充内容,还能自动检查这些细节:
- 页面有没有溢出;
- 各个元素有没有错位乱跑;
- 图片裁切得对不对;
- 图表和标题有没有互相遮挡;
- 整体风格是不是统一协调。
老实讲,对于那些经常要交汇报材料或者研究报告的人来说,这比生成一段文字再自己慢慢调格式实用太多了。你猜怎么着?它能直接给出一份接近可用的成品。
3. 视频理解与剪辑
它可以综合理解画面、语音、字幕、人物关系和时间线,把长视频重新组织成结构化内容。
这类任务的难点其实不在转录,而是在判断——谁在说话、画面发生了什么、哪句话该配哪个镜头。为什么这么说?因为光转文字谁都会,但理解上下文才是真本事。
4. 3D、游戏和 Computer Use
模型可以根据空间描述搭建 3D 场景,根据玩法描述实现可操作的游戏原型,也可以在缺少结构化 API 的情况下通过视觉识别界面并执行连续操作。
```
价格有多激进?和 DeepSeek V4 对比
我看了下最近的活动价,GLM-5.3-Flash 现在这个价:
| 模型 | 使用时段 | 每百万输入 Token | 每百万缓存输入 Token | 每百万输出 Token |
|---|---|---|---|---|
| GLM-5.3-Flash | 首发促销 | 0.40 元 | 0.115 元 | 1.40 元 |
| GLM-5.3-Flash | 常规价格 | 0.80 元 | 0.23 元 | 2.80 元 |
| DeepSeek V4 Flash | 非高峰 | 1.50 元 | 0.05 元 | 4.50 元 |
| DeepSeek V4 Flash | 工作日高峰 | 3.00 元 | 0.10 元 | 9.00 元 |
| DeepSeek V4 Pro | 非高峰 | 4.50 元 | 0.15 元 | 13.50 元 |
| DeepSeek V4 Pro | 工作日高峰 | 9.00 元 | 0.30 元 | 27.00 元 |
说实话,光看输入输出这块,首发那会儿 GLM-5.3-Flash 确实便宜不少。
拿 DeepSeek V4 Flash 非高峰的价格做参照:
- GLM-5.3-Flash 首发输入大概只有它的 27%,这差距真不小。
- 输出的话首发也是 31% 左右的水平。
- 不过常规价的话,输入会到 53%、输出 62%,差距就收窄了。
不过缓存输入 Token 这块,我觉得还是得谨慎点。
如果你的业务重度依赖长上下文缓存,那就别光盯着普通输入输出的价格了。
说实话,如果你做的是 Coding Agent、长文档处理、视觉 Coding 这类场景,或者多轮工具调用,GLM-5.3-Flash 的输入输出成本确实更香。
```html
GLM Coding Plan 也在同步升级
老实讲,GLM-5.3-Flash 现在已经正式纳入 GLM Coding Plan 了。
跟 GLM-5.3 相比的话,Flash 版本在 Coding Plan 里的可用额度直接翻了三倍。
新版套餐用的是积分配额制,平时不用高峰期的时候调用模型,只扣标准积分的一半——
包括整个周末都在内。
我觉得对于想体验 Coding Agent 的人来说,这个套餐设计比单看 API 价格重要多了。说实话,实际跑起来的时候,真正烧额度的往往不是发一条问句那么简单。而是模型在那儿反复看文件、跑命令、开页面、检查结果、再改……循环往复。你懂的。
```
智谱最新福利:7天 Coding Plan 体验卡
最后聊聊这次能直接领的福利。
如果你是订阅了 Coding plan 套餐的用户,这次直接把所有人的使用限额重置!

另外还有一波 GLM Coding Plan 7 天体验卡,给之前没订过相关套餐的朋友准备的。

活动规则大概是这样:
- 每天限量放出 10,000 张;
- 抢完即止,先到先得。
- 主要面向想体验 GLM-5.3-Flash Coding 的同学,老实讲这个挺适合新手试水的,我之前用 Flash 版本写代码体验还不错,速度够快而且基本 bug 不多。
领取地址:https://bigmodel.cn/activity/trial-card/PU9MTWG0PM

至于具体能不能领、能用几次,最终还得看你登录页面后的实际规则……感觉还是以页面为准吧。要试的话建议早点去蹲一波,毕竟限量嘛,晚了估计就没了。
写在最后
GLM-5.3-Flash 的看点,真不只是又出个新模型那么回事。
它真正想抢的,其实是咱们开发者天天都在头秃的那批活儿:
- 写代码并跑起来;
- 看截图还原页面,这块能力确实挺顶的;
- 处理长文档和办公文件;
- 观察真实界面并完成操作,盯着屏幕点点划划,不用手动切来切去;
- 生成结果后继续自检和修正。
如果说 Ox Alpha 是智谱搞的一次匿名盲测,那 GLM-5.3-Flash 就是他们把这套底子正式端出来给开发者用的正式版。你猜怎么着?其实底层能力没大变,就是定位更明确了一点。
模型到底行不行,我倒是认为最靠谱的办法还是自己扔进工作流里跑两圈。
现在至少有一个好消息:价格和体验卡,都给了足够低的试错门槛。随便试试。
FAQ
GLM-5.3-Flash 和 Ox Alpha 是什么关系?
其实就是同一个东西嘛。说实话,Ox Alpha 是之前的匿名测试马甲,GLM-5.3-Flash 是正式官宣的公开版。严格来说不算简单换皮,而是同一次大升级的直接落地。
GLM-5.3-Flash 的价格比 DeepSeek V4 便宜多少?
刚首发那会儿促销力度挺猛的,输入价差不多只有 DeepSeek V4 Flash 非高峰价的 27%,输出价也才 31%。如果是常规价格,大概是 53% 和 62% 的水平。也就是说,日常用也能省下一大半,对吧?
GLM-5.3-Flash 支持哪些模态?
文本、图片、视频、各种文件都能喂进去,吐出来的还是文本。话说回来,这可是 GLM-5 系列里第一个真正意义上原生支持多模态的版本,感觉挺实在的。