AI中转站体检:你花钱点的GPT-4o,可能是被偷换的小模型

AI中转站体检封面图:你点的模型真在跑吗,被红线划掉的气泡写着绝对是真的放心充,墨底气泡写着先查查看

号称 128k 上下文,实测只放行 8k——中间那 120k,被谁吃了?

这不是我编的段子,是一点意思(yidianyisi.com)官网 FAQ 里列的中转站常规操作:卖你顶级模型的价格,塞给你便宜的小模型,上下文砍到脚踝,账单还按原价走。

你在中转站充了钱,点的是 GPT-4o、Claude Sonnet,可服务器上真在跑的是什么,只有店家自己知道。你翻不了它的后台,它也不会主动告诉你。

现在有个工具,替你去问。

一点意思官网检测面板截图:检测范围单站体检多站批量、检测类型、接口协议自动识别、中转站地址与API Key输入框
图源:https://yidianyisi.com 官网截图

给中转站做体检的

一点意思,免费,不用注册,打开 https://yidianyisi.com 就能用。它干的事一句话能说清:填上中转站地址和 key,它用几次极便宜的调用,核对你点的模型是不是真在跑。

整站默认没有服务端,key 只在你浏览器内存里待一会儿,用完就扔,不写盘、不入库,检测历史也只存在你自己浏览器里。对一个手里 key 就是钱的人来说,这个设计比什么都重要。

中转站掺水,常见就四招:偷梁换柱,拿开源小模型冒充 GPT-4o;砍上下文,号称 200k 实际只放行 8k-16k;暗中加价,倍率折算不透明;阉割能力,视觉、工具调用悄悄没了。CSDN 上有篇拆解文章还提到更隐蔽的玩法——按问题难度、用户等级、负载动态偷换,今天真明天假,连你自己都察觉不到。

四根探针,照的就是这些。

它是怎么问出来的

探针一,问它你是谁。多次追问模型的自我认知,看回答跟你要的型号对不对得上,被偷换成小模型的,聊几句就露馅。官网管这叫"最强的反诈手段"。

探针二,故意报错。把 max_tokens 从大到小挨个试,从中转站的报错里反推真实的上下文和输出上限。这一手聪明在:只生成几个字,几乎不花钱,对设了额度墙的站还能绕过墙拿到报错。

探针三,验血。GPT、Claude、Gemini、DeepSeek 各家的分词器切字比率不一样,同一段话各家切出来的 token 数不同——这是改不掉的血统指纹。

探针四,点技能。Function Calling、视觉输入这些高级能力,该在的不在,就有问题。

四路结果揉成一个 0-100 综合体验分,结论三档:暂未发现明显异常 / 可疑 / 无法判断。结果多的话,点「只看可疑」直接筛问题项。

四根探针对比卡:①问身份多次追问可信度最高;②故意报错max_tokens大到小试花费几乎为零;③验血④点技能分词器血统指纹、工具调用视觉该在要在、非文本接口只看元数据
依据:yidianyisi.com 官网探针说明

两个细节,是真懂行

先把丑话说在前面:体检不是白测的,跑的全是你自己的 key。一次检测每个模型约 6 次请求,测 5 个模型就是 30 次调用;方案②上下文窗口实测更是真金白银——逐级塞长文本去撞窗口,按你模型的输入价格实打实计费,模型越贵烧得越狠。工具把这俩做成独立开关,明晃晃标着「便宜」和「费 token」,测之前把额度过一遍脑子,别体检一次把 token 烧光。

一点意思上限探测两方案截图:方案①上限探测标着便宜,从报错解析真实上下文输出上限;方案②上下文窗口实测标着费token,逐级发长输入最准
图源:https://yidianyisi.com 官网截图

另一个是监控清单。中转站最阴的一招不是从头假到尾,而是先给你真模型,等你充了年费,再慢慢换成便宜的。把常用的「站+模型」加进监控,它会记下这次的指纹基线——模型自称、上下文、分词器、向量维度。指纹一变立刻红字告警,还画出健康分走势。

一点意思监控清单截图:定时重测偷换告警,记录指纹基线(模型自称、上下文、分词器、向量维度),从不保存key
图源:https://yidianyisi.com 官网截图

对了,还有个克制:对还没出官方文档的新模型,引擎主动跳过价格和缩水断言,标上 provisional,宁可说「无法判断」也不瞎猜。肯说不知道的工具,比什么都能判的工具可信。

说句公道话

这套东西是启发式推断,不是铁证。分词器指纹只能旁证血统;图片、语音、视频这些非文本接口只能看元数据,测不准加价缩水;监控的自动复检只在页面开着时跑,不是真后台监控;结论可能误判,得多测几次综合看。

还有一条官方自己写出来的:绝大多数站走浏览器直连,key 不过服务器;但遇到不开跨域(CORS)的站,会在征得你同意后改走服务端代发,key 会临时过一遍服务器,用完即弃。纯静态部署时干脆标「无法检测」。把例外明明白白写出来的,比拍胸脯说「绝对安全」的让人踏实。

写完这篇,我拿一个免费分享站(freeshare.cc.cd)实测了一遍:站上挂 16 个模型,我挑 5 个常见的去体检,4 个可疑、1 个无法判断,均分 36。

最典型的是 deepseek-v4.1-flash,29 分,工具原话“多半不是它声称的那个模型”。证据链挺吓人:三道送分题全答错,反复问“你是谁”多次返回空,分词器指纹每字约 1.07 token,usage 里漏出 reasoning_tokens=20——底层疑似是个更小的推理模型。gemini-3.8-flash 同款待遇,25 分。

一点意思实测截图:freeshare 站 deepseek-v4.1-flash 判定可疑 29 分,三道送分题 0/3、模型自称多次返回空、分词器指纹中文每字约 1.07 token、usage 漏出 reasoning_tokens=20,疑似被换成更弱的推理小模型
图源:一点意思(yidianyisi.com)实测截图(2026-09-28,作者实测)

也有意外的收获:glm-5.3-flash 走 OpenAI 兼容口根本连不上,工具自动识别出这站得走 Claude 原生协议;space-bunny-alpha 送分题全对、能看图,但一问身份,一会儿自称 deepseek 一会儿自称 mimo,工具批注“真身几乎不会这样”;kimi-k3 站方渠道限流没连通,工具没硬凑结论,老实标了“无法判断”。

5 个模型 30 次调用,烧的是我自己的 key——前文那句“测试消耗 token”,不是随口提醒。

中转站的便宜,要么真是批发价,要么是从你的模型里抠出来的差价。

体检报告不保证抓到所有骗子,但至少能把明显的筛出来。

下次充值前,先带它去做个体检。

金句卡:中转站的便宜,要么是批发价,要么是从你模型里抠出来的差价——胡聊八道
胡聊八道 · AI中转站体检

你在中转站踩过假模型的坑吗?评论区聊聊。觉得有用点个「在看」,下期接着拆。

常见问题

一点意思收费吗?

工具本身免费、免注册,浏览器打开就用,还能装成桌面应用(PWA)。但注意:检测调用消耗的是你 key 里的 token,每个模型约 6 次请求,上下文窗口实测另按输入价格计费——测贵模型前先想好。

会不会泄露我的 API key?

默认浏览器直连中转站,key 只在内存、不落盘,分享链接和结果图卡也不含 key。例外是不开 CORS 的站,征得同意后走服务端代发,用完即弃。

能测哪些接口?

文本对话最全面;图片生成、向量嵌入、语音合成、视频生成只能靠元数据指纹推断,结论仅供参考。

结论「可疑」就一定是假模型吗?

不一定。这是启发式线索不是确凿证据,建议换个问法多测几次,综合判断。

支持哪些接口协议?

OpenAI 兼容、Gemini 原生、Claude 原生,默认自动识别。有些 Claude 站只开了原生接口,拿不准就用自动。