扩散模型实测:Inception 长文秒出,新号送1亿token
- 免费干货
- 5热度
- 0评论
我第一次用 Inception 的时候,愣了一拍。
一大段文字按了回车,内容不是一字一字往外蹦,是整段、整段"啪"地推到你面前。我以为是网络出错了,反复测试了几遍——不对,它就是这么快。快到什么程度呢:目前我实测过的所有大模型里,它是唯一一个让我怀疑"这速度是不是算错了"的。
这东西叫 Inception,硅谷的 AI 公司,模型叫 Mercury。它跟平时用的聊天机器人不是一个路子:普通模型是一个 token 一个 token 往下挤(叫自回归),Mercury 是扩散模型(dLLM)——官方说法是"从噪声里整体收敛成一段完整文本",一堆 token 并行生成。原理你不用懂,看结果就行:别人挤牙膏,它一次给你一整段。
官网自己也这么宣传:首个 token 延迟不到 300 毫秒,吞吐量是现有常规模型的 5~7 倍。实测下来,确实如此。

网页版:聊天免费,注册送 1 亿 token
网页版在 chat.inceptionlabs.ai,邮箱或 Google 都能注册,不用绑卡。注册完进去,官网页面直接写着:
You have 100M free tokens to get started!
新账号白送 1 亿 token(官方口径,以控制台实际显示为准)。网页端聊天是免费的,日常聊天、长文生成都不花钱,可以放心白嫖一阵。

有个前提:API 需要科学上网
这里是我踩过的坑,直接帮你划出来。
网页聊天免费——但如果你想接 API 自己用(写脚本、接进工具链),得先过一道坎:国内直连官方 API 的相关页面是打不开的。我之前直连过一次,页面白屏,挤半天数据也不出来,换网络才行。
所以要说明白:网页聊天注册后国内就能用;但 API 侧的网页和接口,必须有一个能访问外网的网络环境,否则第一步就过不去。
为什么它这么快?说实话我也不太懂
你问我原理,我答不上几句。官方给的解释是扩散模型从噪声整体展开、能同时生成一段内容;官方数字是首 token 300ms 内、吞吐 5~7 倍。它为什么这么快,我也说不准——我只知道测试下来的体验:

八百到一千字的长文,感觉就是"提交就出"。我拿同样长度的内容跟手头常用的几个模型比过,它明显快出一个档次,而且中文输出很稳定,日常用没什么别扭的地方。
说句公道话
免费送的 1 亿 token 是一次性额度,用完就要考虑套餐(官方公开参考价:输入 $0.20/百万、输出 $0.75/百万——看看就行)。
科学上网那一条再重复一遍:网页聊天免费没问题,但你真的想接 API,网络环境是硬前提。卡在这一步,其它都白搭。
但值不值得试?值得。就冲"秒出"这一个级别的体验,也值得注册一个号进去按回车。测试不花钱,新号送 1 亿 token 不绑卡——真金白银 + 快到离谱,这样的组合真不多见。

几个问得多的问题
Inception 网页版真免费吗?
真免费,日常聊天不花钱;新号还白送 1 亿 token(官方口径,以控制台实际显示为准)。
Inception 需要科学上网吗?
网页聊天国内基本可用;但接 API 必须科学上网,否则官方 API 相关页面直连打不开。
Mercury 是国产模型吗?
不是,硅谷公司做的,和国产模型不是一条道。不过它的中文输出很稳,日常用不别扭。
1 亿 token 用完怎么办?
官网参考价:$0.20/百万(输入)、$0.75/百万(输出)——先白嫖,烧完再考虑。
别人挤牙膏,它一次给你一整段。这种体验,试一次就回不去。