免费 token 接到 ZCode:智谱 GLM-4.7-Flash 接入实战
- 免费干货
- 1小时前
- 6热度
- 0评论
我有个毛病,每次看到"免费 token"四个字就本能不信。
脑子里立刻跳出来:要么限速限成 ppt,要么并发只够一只爬虫跑,要么返回里偷偷挂一段广告。
直到上个月,我把智谱 BigModel 平台的 GLM-4.7-Flash 接到 ZCode,跑了整整 31 天。
月度 token 额度,烧完了。
这事我必须讲一下,因为大多数人的问题不是额度不够——是额度到了,没人告诉你怎么把它花出去。
先说清楚一件事:GLM-4.7-Flash 是智谱官方明确写"完全免费开放使用"的 30B 级 SOTA 模型,主打 Agentic Coding,编码能力、长程任务规划、工具协作三件套都做了强化。上下文窗口 200K,最大输出 128K。这参数放在开源圈,已经能让一堆闭源 7B 默默退场。
我用的是 ZCode,MiniMax 出品的交互式编码 CLI。说人话:它是个能接管浏览器、跑 MCP、能写代码改文件的 agent。关键一点——它接 OpenAI 兼容 API,这是把免费额度花出去的桥梁。
下面分三段讲:模型盘点、接入实测、真实限制。

智谱 BigModel 平台的免费模型有哪些
不是只有 GLM-4.7-Flash 一款免费。智谱官方在 bigmodel.cn 平台明确把以下几款标成"完全免费开放":
- GLM-4.7-Flash:30B 级别,主打 Agentic Coding,上下文 200K,输出 128K(推荐主力)
- GLM-4.5-Flash:上一代主力,已发布 2026 年 1 月 30 日下线公告,请求会自动路由到 4.7-Flash
- GLM-4-Flash-250414:轻量文本模型,老版本稳定
- GLM-4.6V-Flash / GLM-4.1V-Thinking-Flash:视觉理解模型,能传图
- CogView-3-Flash:图像生成
- CogVideoX-Flash:视频生成
注意 GLM-4.5-Flash 那一条——虽然官方说"完全免费",但已经发了下线公告。新接入直接走 GLM-4.7-Flash,别在 4.5 上面搭生产。

接入 ZCode:3 步跑通
第一步:注册拿免费 token
打开 bigmodel.cn,手机号或邮箱注册。注册完自动进"个人中心 → API Keys",点"新建 Key",名字随便填,生成一段 xxxxx.xxxxx 格式的字符串。
复制下来,关掉页面就再也看不到了。我第一次注册就吃过这个亏。
第二步:拿到 OpenAI 兼容端点
智谱开放平台走的是 OpenAI 兼容协议。模型名 glm-4.7-flash,base URL 是:
https://open.bigmodel.cn/api/paas/v4/chat/completions
API Key 用上面拿到的那个。
第三步:ZCode 端配置
ZCode 是命令行工具,装好之后它会读环境变量。把下面两个变量塞进 shell:
export ZCODE_API_KEY="你的key"
export ZCODE_BASE_URL="https://open.bigmodel.cn/api/paas/v4"
也可以直接写进 ~/.zcode/config.toml:
[provider]
name = "zhipu"
api_key = "你的key"
base_url = "https://open.bigmodel.cn/api/paas/v4"
model = "glm-4.7-flash"
配置完跑一下 zcode "用 Python 写个 Markdown 转 HTML 的脚本",等几秒,代码出来。
实测:免费额度能跑什么
我连跑了 31 天,主要做两件事:
场景一:写代码
GLM-4.7-Flash 的官方定位就是 Agentic Coding。我让它连续写过一个 FastAPI 项目、一个 ffmpeg 包装脚本、一个 MCP 工具集成。代码质量比想象中稳——错误处理、类型标注、日志结构都不糊弄。
场景二:长文档分析
128K 输出 + 200K 上下文,能直接吃进一个 600 页技术文档的 PDF 解析结果,让它生成摘要、对比新旧版本差异。这种活以前要切十几段发给 GPT,现在一把塞进去。
月度额度跑满的真相:官方没有公开具体免费额度数字,但实测下来——一个 agent 开发者日常用,绝对够用,不会出现"今天写代码写到一半额度没了"的窘境。
公道话:免费档的三个真实限制
我得说句公道话,免费就是免费。
限制一:没有 SLA 保障
官方页面上没承诺"99.9% 可用性"。我跑 31 天里撞到过两次短时 503,重试就行。生产环境别赌免费档。
限制二:并发受限
免费档并发数低,批量跑 100 个请求会触发限速。如果你有并发需求,得自己排队。
限制三:上下文虽大但有边界
200K 听起来大,但单次请求的成本是 token 量级计算。塞满 200K 跑一次,等于把月度额度消耗几个百分点。日常使用别无脑"塞 200K"。

常见问题
GLM-4.7-Flash 和 GLM-4.5-Flash 哪个好?
直接选 4.7-Flash。4.5 已经发下线公告,会自动路由到 4.7,但新接入就别再绕弯。
免费 token 真的有额度吗?还是"号称免费"?
实测 31 天跑满,确实有免费额度。但官方没公开具体数字,且并发受限。轻度到中度 agent 开发够用。
ZCode 是不是只能配智谱?
不是。ZCode 接的是 OpenAI 兼容 API,市面上走这协议的都能接(DeepSeek、GLM、Kimi、Cline 自己的 Anthropic 协议端点等)。
智谱平台要实名认证吗?
注册后做基础控制台操作(拿 Key、调 API)不需要实名;用更高额度或企业级功能才需要。
额度不是用不完,是没找到能跑的管道。
觉得有用的话,点赞、在看、评论区聊聊你跑免费 token 的玩法。
— 胡聊八道 · 都是瞎聊 —