用 Claude、ChatGPT 这类海外模型的 API 干活,迟早会在群里或者广告里碰到中转站,价格比官方低一半甚至更多,还能用支付宝付款。这篇是AI 工具攻略系列的第 8 篇,也是最后一篇,上一篇讲了各个场景用什么 AI,这一篇回答三个问题,便宜的中转站到底便宜在哪,怎么判断拿到的是不是真模型,钱已经充进去了怎么止损。适合用 API 干活的开发者和替公司挑供应商的人。
AI 中转站是架在用户和模型厂商之间的一层代理服务,它用自己的账号或渠道去调用 Claude、GPT、Gemini 这些模型的接口,再转卖给你,你拿到的是它发的密钥、它的域名和它的价目表。每经网 2026 年 5 月的报道把它定义为介于用户与 AI 模型厂商官方服务之间的代理层,多家模型的接口统一封装,一个密钥就能调用多个模型。
本文核验时的版本。截至 2026 年 9 月 14 日,我对过的材料有 CISPA 的审计论文(arXiv 2603.01919,2026 年 3 月)、《One Token Is Enough》(arXiv 2607.10252,2026 年 7 月)、每经网 5 月的起底报道、科技日报 6 月经新华网转载的甄别指南、Anthropic 的提示缓存文档和定价页。
AI 中转站是什么,为什么会存在
AI 中转站是第三方搭建的模型接口转售服务,CISPA 的论文管它叫 shadow API,定义只有两个特征,间接访问,以及向受限地区提供访问。它存在的第一个原因就是地区限制,截至 2026 年 9 月,Anthropic 和 OpenAI 的支持地区列表都没有中国大陆,官方账号只对受支持地区开放,API 又按美元结算,中转站把这几道门槛都替你跨了。
第二个原因是省事,一个密钥能调好几家的模型,按人民币结算。CISPA 的论文统计了 17 个 shadow API,它们出现在 187 篇学术论文里,最热门的一个被引用 5,966 次,GitHub 上有 58,639 个 star。
中转站有正经的,也有灰黑的。科技日报 2026 年 6 月经新华网转载的甄别指南把它分成三类,第一类是云厂商自己的合规聚合平台,第二类是企业采购官方 API 后分销的正规代理,第三类是搭共享账号池拆分售卖的灰黑产平台,风险逐级上升。
即使是第二类,把 Claude 转卖给终端用户也踩在厂商条款的边上。Anthropic 消费者条款2025 年 10 月的版本写明,用户不得把账号登录信息、API 密钥或账号凭据分享给任何人。Claude Code 文档的法律与合规页写得更直接,客户 “may not pay for, resell, or intermediate Claude usage”,每个终端用户必须用自己的凭据认证。
这意味着中转站的货源随时可能被厂商掐断,你买的是一条随时会失效的通道。
中转站为什么能比官方便宜一大截,五种低价来源
官方 API 是按美元计价、按 token 计费的公开价目,截至 2026 年 9 月,Claude Sonnet 5 每百万 token 输入 2 美元、输出 10 美元。中转站比这个价便宜的每一分钱都得有来源,公开报道里能对上的有五种。
下面这张表的依据是每经网的报道、V2EX 上 2025 年 3 月两篇扒中转站和代充的帖子(编号 1200135、1200385),以及 CISPA 的论文。
| 低价来源 | 钱从哪省的 | 能便宜多少 | 你承担什么 |
|---|---|---|---|
| 汇率与手续费差价 | 正规分销商批量采购官方 API,赚汇率差和几个点的手续费,支持人民币付款 | 接近官方价,有的还要加几个百分点 | 风险最低,但仍在厂商的转售限制之内 |
| 包月额度按量转卖 | 用 Pro、Max 这类固定月费的订阅,反向代理客户端的内部接口,把额度按 token 拆开卖 | 能到官方 API 价的几折 | 订阅号一封就断,额度和速率跟别人共用 |
| 批量账号池与盗刷卡 | 注册机批量建号薅免费额度,虚拟卡订阅后退款,黑卡和礼品卡充值 | 成本接近零,能开出 1 元几百万 token 的价 | 服务随时中断,商家失联,你的数据在别人的账号里 |
| 廉价模型冒充 | 前台写旗舰模型的名字,后台跑几十亿参数的开源模型或同厂低档模型 | 想定多低都行 | 付旗舰的钱,拿到另一个模型 |
| 无缓存计费与暗中减配 | 价目表没有缓存命中这一行,或者截断上下文、关掉思考、限制单次请求的算力 | 标价打折,实际账单未必 | 账单比看上去贵,任务质量下降 |
前两种便宜不了太多,每经网的报道里也提到有正规聚合平台按官方价收费,只加几个百分点的手续费。真能比官方低一半的,来源基本落在后三种。
价格本身就能说明来源。每经网的报道举了一条 1 元兑换 285 万 token 的广告,按 Claude Opus 每百万 token 输入 5 美元的官方价和 7.1 左右的汇率,285 万 token 要 100 元左右。卖 1 元还不亏,要么货是白来的,要么货根本就不是 Opus。
廉价模型冒充旗舰模型的常见套路
冒充是把便宜模型的输出贴上旗舰模型的名字卖给你,接口响应里的 model 字段中转站想填什么就填什么。CISPA 的论文《Real Money, Fake Models》给了第一批系统证据。
论文从 17 个 shadow API 里挑了 3 个做审计,在它们提供的模型端点里,45.83% 没有通过指纹验证,另有 12.50% 的输出与参考模型的余弦距离明显偏离。指纹用的是 LLMmap 框架,把回答和参考库比对。
冒充的方向什么样都有。论文里对上号的例子是,标着 GPT-5 的端点指纹对应 GLM-4-9B,标着 GPT-4o-mini 的对应 Qwen2.5-7B,标着 DeepSeek-Reasoner 的实际是 DeepSeek-Chat。GLM-4-9B 和 Qwen2.5-7B 本身是正经的开源模型,一张显卡就能跑,问题出在有人按旗舰的价卖它们的输出。
差距大到什么程度,同一篇论文测了 Gemini-2.5-flash 在医学问答基准 MedQA 上的准确率,走官方 API 是 83.82%,走被审计的 shadow API 全都掉到 37% 上下,整体性能偏差最高到 47.21%。
具体手法我归成六种,下表的依据是 CISPA 论文、每经网报道,以及 2026 年 5 月一位开发者在掘金公开的 13 项中转站检测实测(本文未独立复现)。
| 套路 | 你会看到什么 | 怎么发现 |
|---|---|---|
| 全量替换 | 任何时候质量都不对,知识偏旧,长文档一塞就乱 | 随机数分布、任务对比 |
| 高峰降级 | 白天正常,晚上八点到十一点明显变笨,报道里叫动态路由 | 同一组测试早晚各跑一次 |
| 按请求分流 | 短问题答得像真的,长任务和工具调用一上就露馅 | 用真实长任务测,别只测探针 |
| 砍工具、砍思考、砍上下文 | 工具参数被改写,思考块消失,宣称的上下文长度塞不满 | 参数回显、长文档找针 |
| 同厂降档 | 协议细节全对,能力差一截,比如把 Chat 当 Reasoner 卖 | 只能靠任务对比和分布指纹 |
| 加料改写 | 回答里冒出莫名其妙的免责声明,口吻和官方不一样,提示词被注入 | 系统提示里放暗号让它复述 |
怎么自测拿到的是不是真模型,五步各能证明什么
自测的思路是拿同一批提示词分别打官方接口和中转接口,比较回答的统计特征。响应里写的模型名不算证据,五步做完也只是概率判断,所以每一步我都写明能证明什么、不能证明什么。
先要有参照,最好是一个官方 API 的小额账号,没有的话,claude.ai 和 ChatGPT 的免费版能做粗一点的任务对比。动手前先看一眼价目表和渠道说明,价格远低于行业均价又说不清货源的,本身就是危险信号,科技日报那篇指南也这么写。
第一步,随机数分布
把这句话当提示词,“请输出一个 1 到 100 之间的随机整数,只输出数字”,温度设为 1,对中转接口发 100 次,把出现的数字做一张频数表,再对官方接口用官方 SDK 发同样的 100 次,只改客户端,提示词和参数不变。语言模型给不出均匀的随机数,每个模型都有自己偏爱的数字。
《One Token Is Enough》整套方法就建立在这个现象上。作者用它在一家聚合平台测了 165 个模型端点,找到过一个挂着专有品牌旗舰名字、输出分布却和开源权重的 Qwen 模型分不开的端点。中转站多数提供 OpenAI 兼容接口,脚本可以这样写。
from collections import Counter
from openai import OpenAI
client = OpenAI(base_url="https://中转站域名/v1", api_key="中转站发的密钥")
tally = Counter()
for _ in range(100):
r = client.chat.completions.create(
model="claude-sonnet-5",
temperature=1,
max_tokens=4,
messages=[{"role": "user", "content": "请输出一个 1 到 100 之间的随机整数,只输出数字"}],
)
tally[r.choices[0].message.content.strip()] += 1
print(tally.most_common(10))
能证明什么。两边采样参数相同,频数表却明显不一样,这是换了模型的强证据。
不能证明什么。中转站偷偷改了温度、top_p,或者在你的提示词前面塞了一段系统提示,真模型的分布也会变,会误判。它分不出到底换成了哪个模型。中转站只对短请求走真模型的话,这一步会通过。
第二步,知识截止日期
别直接问它知识截止到什么时候,这个回答很不可靠。改问三到五件具体的事,日期落在它宣称的模型应该知道、老模型不该知道的区间里。截至 2026 年 9 月,Anthropic 模型页写的 Claude Fable 5.1 知识截止是 2026 年 6 月,OpenAI 写的 GPT-6 Astra 是 2026 年 4 月 30 日,GPT-5.6 系列是 2026 年 2 月 16 日。
对一个自称 Fable 5.1 的端点,可以问 2026 年 2 月 2 日 OpenAI 发布的 Codex 桌面应用是什么。越靠近截止日期的事模型记得越不牢,多问几件不同月份的事,全部答不上或者全在编,才算数。
能证明什么。宣称的模型该知道的那段时间它一片空白,几乎可以肯定后台是更老的模型。
不能证明什么。中转站给模型接了联网搜索,或者往系统提示里塞了新闻,老模型也能答上来。同一代不同档位的截止日期接近,这一步筛不出同厂降档。
第三步,任务型对比
挑三件你平时真的会做的活。一件是有测试的重构,比如三百行代码带单元测试,看它改完测试过不过。一件是长文档找针,在一份几十万字的文本中间埋一句只有你知道的话让它找,宣称 100 万上下文的端点就把针埋到 20 万 token 之后。一件是难一点的推理题。每件事官方和中转各跑三次,早上一轮,晚高峰一轮。
能证明什么。你付钱买的能力有没有交付,包括上下文是不是真有那么长,晚高峰有没有被降级。CISPA 论文里 83.82% 掉到 37% 的差距,用这种任务一测就出来。
不能证明什么。小的差异是采样的随机噪声,三次跑不出统计意义。它说不出后台到底是哪个模型。中转站还可能对流传很广的测试题做过特殊处理,所以要用自己的活,别用网上的题库。
第四步,用工具批量测单 token 输出分布,再核对 token 计数
第一步的手工版做系统了就是这一步。《One Token Is Enough》的探针是 40 个格子,每格是一类跨语言的琐碎单词提示词,每次请求只收一个输出 token,用完整探针做验证的等错误率是 7.3%,缩减到 8 个格子、大约 100 次单 token 请求,错误率也在 11% 以下。照论文的格子设计写个脚本,两边各跑一遍,比较分布距离。
顺手核一下 token 计数。同一段文本发给 Anthropic 免费的计数接口 count_tokens,再看中转站响应里 usage.input_tokens 报了多少,两个数差得远,后台的分词器就不是 Claude 的。比对要用同一个模型版本,Claude 4.7 之后的新分词器比旧的多算约 30%。
能证明什么。在已知错误率下判断中转端点的分布是否和参照模型一致,分词器对不上就是不同的模型家族。
不能证明什么。usage 是经中转站转发的,可以改写,账单核算这类方法公开承认的局限就是中间人可以伪造。7% 到 11% 的错误率意味着单次结论可能错,要多跑几轮。
第五步,参数回显与协议痕迹
这一步不需要参照,查的是中转站有没有动你的请求。把 max_tokens 设成 5,回答必须在 5 个 token 处截断。设一个 stop 序列,回答必须在那里停。温度设 0,同一个问题连发五次,回答应该几乎一样。
再查提示词和工具。在系统提示里放一个随机暗号,比如 X7Q-4419,让它原样复述,复述不出来就是系统提示被换了。定义一个参数名很怪的工具,看返回的调用参数有没有被改,那位开发者的实测里就抓到过工具调用参数被改写和提示词被注入。
协议层也有痕迹。Claude 开了扩展思考后,官方响应里的思考块带一个由 Anthropic 服务器生成的 signature 字段,开源模型的后台给不出这个字段,把思考砍掉的中转站则根本不返回思考块。usage 里的字段名也能看出来,一个号称 GPT 的端点返回了 Claude 专用的 cache_read_input_tokens,就是套了一层壳。
能证明什么。中转站有没有改参数和提示词,有没有动工具调用,协议细节是否和它宣称的厂商一致。
不能证明什么。同厂降档这一步完全查不出来,Sonnet 冒充 Opus 的签名和字段全是真的。做得仔细的中转站也能把这些字段洗干净。
五步各自的成本和边界汇总如下。
| 步骤 | 花费 | 能证明 | 不能证明 |
|---|---|---|---|
| 随机数分布 | 200 次短请求 | 分布与参照不同 | 换成了哪个模型,参数是否被改 |
| 知识截止日期 | 几次对话 | 后台是更老的模型 | 同厂降档,接了搜索的老模型 |
| 任务型对比 | 几美元和半天时间 | 能力和上下文长度是否交付,高峰是否降级 | 后台具体是谁,小差异 |
| 单 token 分布工具与计数核对 | 100 到 300 次单 token 请求 | 已知错误率下的指纹匹配,分词器家族 | 被改写的 usage,按长度分流 |
| 参数回显与协议痕迹 | 十几次请求 | 请求有没有被动过,厂商协议是否吻合 | 同厂降档,洗过字段的中转 |
折扣之外的隐性成本,一个七折但没有提示缓存的算例
官方价目表有缓存命中这一行,很多中转站的价目表没有,这一行的差价经常大过它给你的折扣。提示缓存是什么、怎么计费,token 那篇讲过,这里只用官方倍率算一笔账。
Anthropic 提示缓存文档写的倍率是,5 分钟缓存写入按基础输入价的 1.25 倍,1 小时缓存写入 2 倍,缓存命中 0.1 倍,Fable 5.1 和 Mythos 5.1 的命中是 0.025 倍。Claude Code 这类智能体工具每一轮都把整段对话重发一遍,前面没变的部分全按命中价读。
场景这样设。一次 Claude Code 会话,一天 200 次请求,每次请求平均带 4 万 token 输入,其中 3.6 万是没变的前缀,包括系统提示、CLAUDE.md、工具定义和之前的对话,4 千是新内容,每次输出 800 token。
模型用 Sonnet 5,官方单价按 2026 年 9 月 14 日的定价页,输入 2 美元、5 分钟缓存写入 2.5 美元、缓存命中 0.2 美元、输出 10 美元,都是每百万 token。中转站按官方基础价打七折,输入 1.4 美元、输出 7 美元,价目表上没有缓存。
| 项目 | 官方,带缓存 | 中转,七折无缓存 |
|---|---|---|
| 新内容 80 万 token | 按缓存写入价 2.5 美元,2.00 美元 | 按 1.4 美元,1.12 美元 |
| 重复前缀 720 万 token | 按命中价 0.2 美元,1.44 美元 | 按 1.4 美元,10.08 美元 |
| 输出 16 万 token | 按 10 美元,1.60 美元 | 按 7 美元,1.12 美元 |
| 一天合计 | 5.04 美元 | 12.32 美元 |
七折的中转站一天要 12.32 美元,官方 5.04 美元,中转是官方的 2.4 倍。把中转的折扣压到三折再算,合计 5.28 美元,还是比官方贵。按这个用法,中转站要低于三折才开始真的省钱,而低于三折的价格,货源大概率是上面说的后三种。
这笔账的前提是你的用法有大量重复前缀。零散地问几个短问题,前缀不重复,缓存派不上用场,七折就是七折。判断中转站有没有把缓存价传给你,看三处,价目表有没有缓存命中这一行,第二次请求的 usage 里 cache_read_input_tokens 是不是大于零,账单明细有没有按命中价扣。
缓存之外还有时间和返工的账。每经网的报道提到多租户限流卡住单个请求的 GPU 时间,智能体任务超时重试也要花 token。降智改坏的代码要人再改一遍。宣称 100 万上下文实际只有 20 万的端点,长文档任务直接做不了,有开源检测项目的作者报告过这种案例。
最后一笔是隐私。你发出去的代码、文档、密钥都完整经过中转站的服务器。每经网的报道引述律师梁帆的说法,中转站私自保存用户的 prompt、代码、商业文件,用于训练模型或出售数据,可能构成不正当竞争和非法收集处理个人信息,严重时面临刑事风险。
中转站跑路前兆与软跑路
中转站跑路很少是突然的,多数会先经过涨价、限充和降质量的阶段,和机场跑路前的常见迹象几乎是同一套流程。V2EX 那篇帖子把周期写成四段,先低价送额度,然后涨价、稳定性下降,用户吐槽就封号,最后域名消失,余额归零。
涨价有公开的数字。每经网的报道里,有中转站根据官方封号的情况频繁调价,涨幅到三四倍,有用户反映月租从 70 元涨到原来的三到四倍。涨价本身就是货源在断的信号。
软跑路是站还在,钱没了。常见的样子是公告说系统升级,余额按折扣迁移到新域名,老域名过一阵关掉,或者旗舰模型长期维护中,余额只能用在特价模型上。优惠码那篇讲的折扣套路,换成充值送额度就是中转站的版本。
| 前兆 | 说明 | 建议动作 |
|---|---|---|
| 突然的大额充值优惠 | 充 1000 送 1000 这类活动,往往是关站前最后一次集中收钱 | 不充,已有余额抓紧用 |
| 旗舰模型频繁维护、晚高峰降智 | 账号池被封或者已经换了后台 | 跑第三步的任务对比 |
| 价格一个月内调几次 | 货源在断 | 停止追加 |
| 余额迁移、老套餐下架 | 软跑路开始 | 不迁移,按止损清单处理 |
| 暂停充值或只剩一种支付方式 | 支付通道被风控或者准备关站 | 保存证据 |
| 退款拖延、客服群禁言 | 已经在跑 | 投诉,换渠道 |
外部压力也会让中转站一夜消失。据中新网报道,中央网信办 2026 年 4 月 30 日启动清朗专项行动整治 AI 应用乱象,第一阶段处置违规 AI 产品 1.4 万余款、账号 2.6 万余个,下架商品 1300 余个。
更早的执法案例在 2023 年。据界面新闻报道,上海一家公司在 2022 年 12 月到 2023 年 2 月之间用公众号收费提供 ChatGPT 问答,付费用户 4,231 人,违法经营额 125,385.44 元,徐汇区市场监管局当年 4 月罚款 62,692.7 元,此案后来被列入上海市场监管部门的典型案例。
已经充了钱怎么止损
已经充了钱的人,第一件事是停止再充,第二件事是把经中转站发出去的东西当成已经泄露处理。下面这份清单按先后顺序排。
- 不追加,不参加余额迁移。迁到新域名的余额,跟着的是同一批人。
- 余额只用在不含敏感数据的活上。翻译公开文档、写草稿都行,公司代码、客户数据、带密钥的配置不要再经过它。
- 轮换凭据。任何在对话或代码里出现过的 API 密钥、数据库密码、
.env内容、访问令牌,全部换掉。公司项目按泄露事件的流程走。 - 保存证据。充值记录、价目表、宣传页、群公告、客服对话都截图。投诉渠道有支付平台的交易投诉和 12315,能不能追回我不下结论。
- 回官方渠道。Claude 从注册到下载和Codex 从注册到下载两篇写了官方能走通的路,日常问答和翻译这类任务,国产模型能替代到什么程度那篇给了不翻墙的搭配,企业用户优先看云厂商自己的模型服务平台。
- 以后再试任何中转,先按第三步和第五步测一遍,再用挑机场那套清单看它的运营主体、口碑可查性和退路成本。先充最低额度,和买机场先月付是一个道理。
中转站这件事到这里讲完了。这是系列的最后一篇,前面七篇按开发者和普通用户两条阅读路径排在AI 工具攻略栏目页,从哪篇开始看都行。
常见问题
AI 中转站为什么比官方便宜那么多?
怎么判断中转站给的是不是真模型?
用中转站会泄露代码和数据吗?
中转站打七折真的比官方省钱吗?
用中转站会违反 Anthropic 的条款吗?
中转站跑路前有什么征兆?
中转站跑路了,充的钱还能追回吗?
发现信息过期或错误?欢迎联系纠错,我会尽快复核更新。