扩散模型实测:Inception 长文秒出,新号送1亿token

我第一次用 Inception 的时候,愣了一拍。

一大段文字按了回车,内容不是一字一字往外蹦,是整段、整段"啪"地推到你面前。我以为是网络出错了,反复测试了几遍——不对,它就是这么快。快到什么程度呢:目前我实测过的所有大模型里,它是唯一一个让我怀疑"这速度是不是算错了"的。

这东西叫 Inception,硅谷的 AI 公司,模型叫 Mercury。它跟平时用的聊天机器人不是一个路子:普通模型是一个 token 一个 token 往下挤(叫自回归),Mercury 是扩散模型(dLLM)——官方说法是"从噪声里整体收敛成一段完整文本",一堆 token 并行生成。原理你不用懂,看结果就行:别人挤牙膏,它一次给你一整段。

官网自己也这么宣传:首个 token 延迟不到 300 毫秒,吞吐量是现有常规模型的 5~7 倍。实测下来,确实如此。

扩散模型实测 Inception 封面图

网页版:聊天免费,注册送 1 亿 token

网页版在 chat.inceptionlabs.ai,邮箱或 Google 都能注册,不用绑卡。注册完进去,官网页面直接写着:

You have 100M free tokens to get started!

新账号白送 1 亿 token(官方口径,以控制台实际显示为准)。网页端聊天是免费的,日常聊天、长文生成都不花钱,可以放心白嫖一阵。

Inception 官网新号赠送 1 亿 token 截图

有个前提:API 需要科学上网

这里是我踩过的坑,直接帮你划出来。

网页聊天免费——但如果你想接 API 自己用(写脚本、接进工具链),得先过一道坎:国内直连官方 API 的相关页面是打不开的。我之前直连过一次,页面白屏,挤半天数据也不出来,换网络才行。

所以要说明白:网页聊天注册后国内就能用;但 API 侧的网页和接口,必须有一个能访问外网的网络环境,否则第一步就过不去。

为什么它这么快?说实话我也不太懂

你问我原理,我答不上几句。官方给的解释是扩散模型从噪声整体展开、能同时生成一段内容;官方数字是首 token 300ms 内、吞吐 5~7 倍。它为什么这么快,我也说不准——我只知道测试下来的体验:

Inception 长文本生成秒出实测截图

八百到一千字的长文,感觉就是"提交就出"。我拿同样长度的内容跟手头常用的几个模型比过,它明显快出一个档次,而且中文输出很稳定,日常用没什么别扭的地方。

说句公道话

免费送的 1 亿 token 是一次性额度,用完就要考虑套餐(官方公开参考价:输入 $0.20/百万、输出 $0.75/百万——看看就行)。

科学上网那一条再重复一遍:网页聊天免费没问题,但你真的想接 API,网络环境是硬前提。卡在这一步,其它都白搭。

但值不值得试?值得。就冲"秒出"这一个级别的体验,也值得注册一个号进去按回车。测试不花钱,新号送 1 亿 token 不绑卡——真金白银 + 快到离谱,这样的组合真不多见。

金句:别人挤牙膏它一次给你一整段

几个问得多的问题

Inception 网页版真免费吗?

真免费,日常聊天不花钱;新号还白送 1 亿 token(官方口径,以控制台实际显示为准)。

Inception 需要科学上网吗?

网页聊天国内基本可用;但接 API 必须科学上网,否则官方 API 相关页面直连打不开。

Mercury 是国产模型吗?

不是,硅谷公司做的,和国产模型不是一条道。不过它的中文输出很稳,日常用不别扭。

1 亿 token 用完怎么办?

官网参考价:$0.20/百万(输入)、$0.75/百万(输出)——先白嫖,烧完再考虑。

别人挤牙膏,它一次给你一整段。这种体验,试一次就回不去。