GLM-5.3-Flash来了:神秘Ox Alpha揭开真身,价格比DeepSeek便宜一半

昨晚(8月26日),智谱突然放出了 GLM-5.3-Flash。

如果你关注过那个在多个平台上引发讨论的匿名模型 Ox Alpha,那么这次基本可以确认:它的真身,就是 GLM-5.3-Flash。

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,把视觉理解塞进了 Coding 和 Agent 的工作循环里,同时价格压到了很激进的位置。

Ox Alpha 终于有了正式名字

说实话,在正式发布前,Ox Alpha 可是顶着个匿名模型的身份跑了挺久测试,不少开发者都体验过……

你发现没,它给人的感觉压根不像是在「聊天」,而是实打实干活的——写代码、调工具、搞复杂任务,搞砸了还会自己调整,对吧?

话说回来,当时就有人扒出这可能是智谱在跑的新模型,现在看来确实如此。

不过我得先提一嘴,模型在不同平台、不同推理配置下的表现确实会有差异,这点你们心里得有数。

我把 Ox Alpha 直接理解成 GLM-5.3-Flash 的匿名测试阶段,更准确地说——它们就是一回事,同一次能力升级而已。

它到底升级了什么?

说实话,智谱这次公布的基础参数……还挺有意思的:

  • 总参数量:320B
  • 激活参数量:18B
  • 上下文窗口:1M
  • 最大输出:128K
  • 输入模态:文本、图片、视频、文件
  • 输出模态:文本
  • 模型代码:glm-5.3-flash

我觉得最值得关注的,是它的架构换了。

相比 GLM-5.3,注意力计算量直接砍了大约 3 倍,KV Cache 也小了将近 4.5 倍——这数字看着挺猛,对吧?

这意味着什么?

你平时随便聊聊可能感觉不到区别。但如果你要处理很长的代码库、翻一堆文档、或者跑那种多轮的 Agent 任务……推理成本、响应速度、还有能扛多久不崩,这些才是关键。

老实讲,它不像是在卷"这道题能不能答满分",更像是在拼命把自己打造成能让你长时间依赖的工作伙伴。

原生多模态,不只是能识图

说实话,现在支持图片输入的模型真不少,但 GLM-5.3-Flash 有意思的地方在于——它想让视觉能力真正参与到任务执行里,而不只是「看个图」就完事了。

举个例子:

  1. 直接读网页截图,布局、组件、交互关系全给你摸清楚;
  2. 根据截图直接生成前端代码;
  3. 页面跑起来,看真实渲染效果;
  4. 再拿参考图一对比,错位在哪、溢出有没有、颜色间距对不对,一眼看出来;
  5. 改完代码?没问题,再来一轮检查。

智谱管这叫「视觉 Coding」。

我以前也用过不少 Coding Agent,老实讲,它们大多只能看代码和终端日志。但你想想,前端页面、游戏、3D 场景这些玩意儿,最后不都得靠眼睛验收对吧?

代码没报错,页面就能好看吗?我倒是认为未必。

```html

Coding 之外,它还想做什么?

1. 前端与浏览器操作

说实话,它的能力远不止写代码。你扔给它一张截图、一段录屏,或者随便一个网页链接,它都能试着还原出能跑的前端项目。

最让我觉得有意思的是,它能在写代码、开浏览器看效果、自己上手点一点之间来回切换。发现问题再改回去,观察→实现→试用→修正,这一套下来基本就是一个完整闭环。

2. Office 成品交付

话说回来,它在 Office 这块也下了一番功夫。

不只是帮你填充内容,还能自动检查这些细节:

  • 页面有没有溢出;
  • 各个元素有没有错位乱跑;
  • 图片裁切得对不对;
  • 图表和标题有没有互相遮挡;
  • 整体风格是不是统一协调。

老实讲,对于那些经常要交汇报材料或者研究报告的人来说,这比生成一段文字再自己慢慢调格式实用太多了。你猜怎么着?它能直接给出一份接近可用的成品。

3. 视频理解与剪辑

它可以综合理解画面、语音、字幕、人物关系和时间线,把长视频重新组织成结构化内容。

这类任务的难点其实不在转录,而是在判断——谁在说话、画面发生了什么、哪句话该配哪个镜头。为什么这么说?因为光转文字谁都会,但理解上下文才是真本事。

4. 3D、游戏和 Computer Use

模型可以根据空间描述搭建 3D 场景,根据玩法描述实现可操作的游戏原型,也可以在缺少结构化 API 的情况下通过视觉识别界面并执行连续操作。

```

价格有多激进?和 DeepSeek V4 对比

我看了下最近的活动价,GLM-5.3-Flash 现在这个价:

模型 使用时段 每百万输入 Token 每百万缓存输入 Token 每百万输出 Token
GLM-5.3-Flash 首发促销 0.40 元 0.115 元 1.40 元
GLM-5.3-Flash 常规价格 0.80 元 0.23 元 2.80 元
DeepSeek V4 Flash 非高峰 1.50 元 0.05 元 4.50 元
DeepSeek V4 Flash 工作日高峰 3.00 元 0.10 元 9.00 元
DeepSeek V4 Pro 非高峰 4.50 元 0.15 元 13.50 元
DeepSeek V4 Pro 工作日高峰 9.00 元 0.30 元 27.00 元

说实话,光看输入输出这块,首发那会儿 GLM-5.3-Flash 确实便宜不少。

拿 DeepSeek V4 Flash 非高峰的价格做参照:

  • GLM-5.3-Flash 首发输入大概只有它的 27%,这差距真不小。
  • 输出的话首发也是 31% 左右的水平。
  • 不过常规价的话,输入会到 53%、输出 62%,差距就收窄了。

不过缓存输入 Token 这块,我觉得还是得谨慎点。

如果你的业务重度依赖长上下文缓存,那就别光盯着普通输入输出的价格了。

说实话,如果你做的是 Coding Agent、长文档处理、视觉 Coding 这类场景,或者多轮工具调用,GLM-5.3-Flash 的输入输出成本确实更香。

```html

GLM Coding Plan 也在同步升级

老实讲,GLM-5.3-Flash 现在已经正式纳入 GLM Coding Plan 了。

跟 GLM-5.3 相比的话,Flash 版本在 Coding Plan 里的可用额度直接翻了三倍。

新版套餐用的是积分配额制,平时不用高峰期的时候调用模型,只扣标准积分的一半——

包括整个周末都在内。

我觉得对于想体验 Coding Agent 的人来说,这个套餐设计比单看 API 价格重要多了。说实话,实际跑起来的时候,真正烧额度的往往不是发一条问句那么简单。而是模型在那儿反复看文件、跑命令、开页面、检查结果、再改……循环往复。你懂的。

```

智谱最新福利:7天 Coding Plan 体验卡

最后聊聊这次能直接领的福利。

如果你是订阅了 Coding plan 套餐的用户,这次直接把所有人的使用限额重置!

另外还有一波 GLM Coding Plan 7 天体验卡,给之前没订过相关套餐的朋友准备的。

活动规则大概是这样:

  • 每天限量放出 10,000 张;
  • 抢完即止,先到先得。
  • 主要面向想体验 GLM-5.3-Flash Coding 的同学,老实讲这个挺适合新手试水的,我之前用 Flash 版本写代码体验还不错,速度够快而且基本 bug 不多。

领取地址:https://bigmodel.cn/activity/trial-card/PU9MTWG0PM

至于具体能不能领、能用几次,最终还得看你登录页面后的实际规则……感觉还是以页面为准吧。要试的话建议早点去蹲一波,毕竟限量嘛,晚了估计就没了。

写在最后

GLM-5.3-Flash 的看点,真不只是又出个新模型那么回事。

它真正想抢的,其实是咱们开发者天天都在头秃的那批活儿:

  • 写代码并跑起来;
  • 看截图还原页面,这块能力确实挺顶的;
  • 处理长文档和办公文件;
  • 观察真实界面并完成操作,盯着屏幕点点划划,不用手动切来切去;
  • 生成结果后继续自检和修正。

如果说 Ox Alpha 是智谱搞的一次匿名盲测,那 GLM-5.3-Flash 就是他们把这套底子正式端出来给开发者用的正式版。你猜怎么着?其实底层能力没大变,就是定位更明确了一点。

模型到底行不行,我倒是认为最靠谱的办法还是自己扔进工作流里跑两圈。

现在至少有一个好消息:价格和体验卡,都给了足够低的试错门槛。随便试试。

FAQ

GLM-5.3-Flash 和 Ox Alpha 是什么关系?

其实就是同一个东西嘛。说实话,Ox Alpha 是之前的匿名测试马甲,GLM-5.3-Flash 是正式官宣的公开版。严格来说不算简单换皮,而是同一次大升级的直接落地。

GLM-5.3-Flash 的价格比 DeepSeek V4 便宜多少?

刚首发那会儿促销力度挺猛的,输入价差不多只有 DeepSeek V4 Flash 非高峰价的 27%,输出价也才 31%。如果是常规价格,大概是 53% 和 62% 的水平。也就是说,日常用也能省下一大半,对吧?

GLM-5.3-Flash 支持哪些模态?

文本、图片、视频、各种文件都能喂进去,吐出来的还是文本。话说回来,这可是 GLM-5 系列里第一个真正意义上原生支持多模态的版本,感觉挺实在的。