免费 token 接到 ZCode:智谱 GLM-4.7-Flash 接入实战

我有个毛病,每次看到"免费 token"四个字就本能不信。

脑子里立刻跳出来:要么限速限成 ppt,要么并发只够一只爬虫跑,要么返回里偷偷挂一段广告。

直到上个月,我把智谱 BigModel 平台的 GLM-4.7-Flash 接到 ZCode,跑了整整 31 天。

月度 token 额度,烧完了。

这事我必须讲一下,因为大多数人的问题不是额度不够——是额度到了,没人告诉你怎么把它花出去。

先说清楚一件事:GLM-4.7-Flash 是智谱官方明确写"完全免费开放使用"的 30B 级 SOTA 模型,主打 Agentic Coding,编码能力、长程任务规划、工具协作三件套都做了强化。上下文窗口 200K,最大输出 128K。这参数放在开源圈,已经能让一堆闭源 7B 默默退场。

我用的是 ZCode,MiniMax 出品的交互式编码 CLI。说人话:它是个能接管浏览器、跑 MCP、能写代码改文件的 agent。关键一点——它接 OpenAI 兼容 API,这是把免费额度花出去的桥梁。

下面分三段讲:模型盘点、接入实测、真实限制。

免费 token 接到 ZCode 封面

智谱 BigModel 平台的免费模型有哪些

不是只有 GLM-4.7-Flash 一款免费。智谱官方在 bigmodel.cn 平台明确把以下几款标成"完全免费开放":

  • GLM-4.7-Flash:30B 级别,主打 Agentic Coding,上下文 200K,输出 128K(推荐主力)
  • GLM-4.5-Flash:上一代主力,已发布 2026 年 1 月 30 日下线公告,请求会自动路由到 4.7-Flash
  • GLM-4-Flash-250414:轻量文本模型,老版本稳定
  • GLM-4.6V-Flash / GLM-4.1V-Thinking-Flash:视觉理解模型,能传图
  • CogView-3-Flash:图像生成
  • CogVideoX-Flash:视频生成

注意 GLM-4.5-Flash 那一条——虽然官方说"完全免费",但已经发了下线公告。新接入直接走 GLM-4.7-Flash,别在 4.5 上面搭生产。

智谱 BigModel 平台免费模型三件套对比

接入 ZCode:3 步跑通

第一步:注册拿免费 token

打开 bigmodel.cn,手机号或邮箱注册。注册完自动进"个人中心 → API Keys",点"新建 Key",名字随便填,生成一段 xxxxx.xxxxx 格式的字符串。

复制下来,关掉页面就再也看不到了。我第一次注册就吃过这个亏。

第二步:拿到 OpenAI 兼容端点

智谱开放平台走的是 OpenAI 兼容协议。模型名 glm-4.7-flash,base URL 是:

https://open.bigmodel.cn/api/paas/v4/chat/completions

API Key 用上面拿到的那个。

第三步:ZCode 端配置

ZCode 是命令行工具,装好之后它会读环境变量。把下面两个变量塞进 shell:

export ZCODE_API_KEY="你的key"
export ZCODE_BASE_URL="https://open.bigmodel.cn/api/paas/v4"

也可以直接写进 ~/.zcode/config.toml

[provider]
name = "zhipu"
api_key = "你的key"
base_url = "https://open.bigmodel.cn/api/paas/v4"
model = "glm-4.7-flash"

配置完跑一下 zcode "用 Python 写个 Markdown 转 HTML 的脚本",等几秒,代码出来。

实测:免费额度能跑什么

我连跑了 31 天,主要做两件事:

场景一:写代码

GLM-4.7-Flash 的官方定位就是 Agentic Coding。我让它连续写过一个 FastAPI 项目、一个 ffmpeg 包装脚本、一个 MCP 工具集成。代码质量比想象中稳——错误处理、类型标注、日志结构都不糊弄。

场景二:长文档分析

128K 输出 + 200K 上下文,能直接吃进一个 600 页技术文档的 PDF 解析结果,让它生成摘要、对比新旧版本差异。这种活以前要切十几段发给 GPT,现在一把塞进去。

月度额度跑满的真相:官方没有公开具体免费额度数字,但实测下来——一个 agent 开发者日常用,绝对够用,不会出现"今天写代码写到一半额度没了"的窘境。

公道话:免费档的三个真实限制

我得说句公道话,免费就是免费。

限制一:没有 SLA 保障

官方页面上没承诺"99.9% 可用性"。我跑 31 天里撞到过两次短时 503,重试就行。生产环境别赌免费档。

限制二:并发受限

免费档并发数低,批量跑 100 个请求会触发限速。如果你有并发需求,得自己排队。

限制三:上下文虽大但有边界

200K 听起来大,但单次请求的成本是 token 量级计算。塞满 200K 跑一次,等于把月度额度消耗几个百分点。日常使用别无脑"塞 200K"。

金句:额度不是用不完,是没找到能跑的管道

常见问题

GLM-4.7-Flash 和 GLM-4.5-Flash 哪个好?

直接选 4.7-Flash。4.5 已经发下线公告,会自动路由到 4.7,但新接入就别再绕弯。

免费 token 真的有额度吗?还是"号称免费"?

实测 31 天跑满,确实有免费额度。但官方没公开具体数字,且并发受限。轻度到中度 agent 开发够用。

ZCode 是不是只能配智谱?

不是。ZCode 接的是 OpenAI 兼容 API,市面上走这协议的都能接(DeepSeek、GLM、Kimi、Cline 自己的 Anthropic 协议端点等)。

智谱平台要实名认证吗?

注册后做基础控制台操作(拿 Key、调 API)不需要实名;用更高额度或企业级功能才需要。

额度不是用不完,是没找到能跑的管道。

觉得有用的话,点赞、在看、评论区聊聊你跑免费 token 的玩法。

— 胡聊八道 · 都是瞎聊 —