刚注册完 Claude 或 ChatGPT 的人,第一个绕不开的问题是要不要花 20 美元订 Pro,订完以后第二个问题往往是,为什么聊着聊着就提示用量到了上限。两个问题背后是同一个东西,token。这篇是AI 工具攻略系列的第 4 篇,上一篇比较了桌面版和网页版的区别,这一篇只讲钱怎么算、额度怎么扣、怎么少花。看这篇不需要任何基础,会加减乘除就够。
token 是大语言模型读写文字的最小计量单位。你发给 Claude、ChatGPT 的每句话,它们回给你的每个字,都先被切成 token,再按 token 数量计费或者扣用量额度。Anthropic 的术语表说一个 token 大约对应 3.5 个英文字符,OpenAI 的帮助文档说大约 4 个英文字符或 0.75 个英文单词,两家都没有给出中文的官方换算。
本文核验时的版本。截至 2026 年 9 月 14 日,我把 Anthropic 的模型定价页、提示缓存文档、Claude 订阅页、Claude Code 成本文档,以及 OpenAI 的 API 定价页和 Codex 帮助文章各对了一遍。
Claude 这边的现行模型是 Fable 5.1、Opus 5、Sonnet 5 和 Haiku 4.5,OpenAI 这边是 GPT-6 Astra 和 GPT-5.6 的 Sol、Terra、Luna 三档。模型名换得很快,文里所有价格都以这一天的官方页为准。
token 是什么意思,一个 token 等于几个汉字
token 是分词器把文字切开之后的最小单位,可以是一个完整的英文单词、半个单词、一个标点,也可以是一两个汉字。模型不认字,它认的是每个 token 对应的编号,算的是编号之间的概率。
汉字换算只有实测口径。我 9 月 14 日在 OpenAI 的 Tokenizer 页面贴了两段中文,59 个汉字算出 37 个 token,108 个汉字算出 70 个 token,折下来每个汉字大约 0.65 个 token,也就是 1 个 token 约等于 1.5 个汉字。这是单次样本,换一段标点多、生僻字多的文字,数字会变。
分词器的版本也会改数字。Anthropic 定价页注明,Claude 4.7 及之后的模型换了新分词器,同样的文字大约多出 30% 的 token,Sonnet 4.6 及更早的模型用旧分词器。所以同一段中文,在 Sonnet 5 上和在 Sonnet 4.6 上算出来的 token 数不一样,网上流传的每字多少 token 的说法,先看它是用哪个分词器量的。
下面这张换算表的数据来自 Anthropic 定价页、OpenAI 帮助文档和上面那次实测,核对日期 2026 年 9 月 14 日,全部是大约值。
| 内容 | 大约多少 token | 依据 |
|---|---|---|
| 1000 个英文字符 | 250 到 290 | Anthropic 术语表 3.5 字符一个 token,定价页 FAQ 4 字符一个 token |
| 1000 个英文单词 | 约 1330 | 两家都写 0.75 个单词一个 token |
| 1000 个汉字 | 约 650 到 700 | OpenAI Tokenizer 页两段样本,0.65 token 一个汉字 |
| 同一段文字换到 Claude 4.7 及之后的模型 | 再多约 30% | Anthropic 定价页分词器说明 |
| 一个 10 kB 的普通网页 | 约 2,500 | Anthropic 定价页 web fetch 示例 |
| 一份 500 kB 的论文 PDF | 约 125,000 | 同上 |
| 代码 | 无官方口径,符号、缩进和换行都占 token,按字符数算通常比英文散文更费 | 建议实测 |
要精确数字就别估,两家都有免费工具。OpenAI 的 Tokenizer 页面贴进去就出结果,Anthropic 有一个免费的 token 计数接口,POST /v1/messages/count_tokens,返回的是估算值但不收费。Claude Code 里输入 /context 能看到当前对话占了多少。
模型、上下文和生成,三个词就够用
模型是一大堆参数,它只做一件事,看着前面所有 token,算下一个 token 最可能是什么。上下文是它这一次能看到的全部内容,系统提示、你之前说的话、上传的文件、工具返回的结果都在里面,也包括它自己正在写的回答。生成是一个 token 一个 token 往外写,每写一个,就接到上下文末尾,再算下一个。
模型本身在两次请求之间什么都不保存。网页版的对话历史和记忆功能,都是产品在模型外面另存了一份,下一次请求时再塞回上下文。这一点决定了后面所有的价格问题,每一轮都是同一个模型把整段历史重新读一遍。
AI 是怎么算钱的,输入和输出为什么价格不同
AI 按 token 数量计费,输入和输出分开算。2026 年 9 月的官方价,Claude 现行四个模型的输出单价都是输入的 5 倍,OpenAI 的 GPT-6 Astra 也是 5 倍,GPT-5.6 Terra 和 Luna 是 6 倍。
输入是你发过去的全部内容,输出是模型写回来的内容。API 账单上这两项分开列,订阅用户看不到账单,但用量额度按同样的思路扣。
输出贵,定价页不解释原因,从生成方式上能看出来。输入可以一次并行读完,几万 token 的文档过一遍就算完了。输出做不到,每个 token 都要把整个模型完整跑一遍,写 1000 个 token 就是跑 1000 遍,中间还得一直占着算力等你这个请求写完。
还有一类你看不见的 token。OpenAI 把模型的推理过程记作 reasoning token,用户看不到内容,账单上按输出价收;Anthropic 的扩展思考同样按输出 token 计费。开了深度思考问一个简单问题,账单会比回答本身的长度高出不少。
Claude 的 API 单价如下,数据来自 Anthropic 定价文档,单位是美元每百万 token,核对日期 2026 年 9 月 14 日。Sonnet 5 的 2 美元和 10 美元原本是介绍价,官方已经改为长期标准价。
| 模型 | 基础输入 | 5 分钟缓存写入 | 1 小时缓存写入 | 缓存命中 | 输出 |
|---|---|---|---|---|---|
| Claude Fable 5.1 | $10 | $12.50 | $20 | $0.25 | $50 |
| Claude Opus 5 | $5 | $6.25 | $10 | $0.50 | $25 |
| Claude Sonnet 5 | $2 | $2.50 | $4 | $0.20 | $10 |
| Claude Haiku 4.5 | $1 | $1.25 | $2 | $0.10 | $5 |
OpenAI 的单价来自 OpenAI API 定价页,同样是美元每百万 token,同一天核对。定价页注明这些是 272K 上下文以内的标准费率。
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| GPT-6 Astra | $10 | $1 | $50 |
| GPT-5.6 Sol,促销价至少到 2026 年 11 月 21 日 | $4,原价 $5 | $0.40,原价 $0.50 | $20,原价 $30 |
| GPT-5.6 Terra | $2 | $0.20 | $12 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 |
拿 Sonnet 5 算一笔。贴一份 1 万汉字的文档让它总结,按上面的换算输入大约 6500 到 8500 token,不到 2 美分;它回 500 字,输出 300 多 token,不到 1 美分。单看一次很便宜,贵在后面,同一份文档每多问一句,它都要把文档重读一遍。
两家都有一个五折通道。不着急要结果的任务走 Batch API,异步处理,输入和输出都打五折,Anthropic 和 OpenAI 的规则一样。写脚本批量处理文档的开发者应该先看这一项。
上下文窗口是什么,为什么越聊越贵
上下文窗口是模型一次请求能看到的内容上限,Anthropic 的定义是模型生成回答时能引用的全部文本,包括回答本身。截至 2026 年 9 月,Fable 5.1、Opus 5、Sonnet 5 在 API 上都是 100 万 token,claude.ai 网页版四个档位都是 20 万。
越聊越贵的原因就是前面说的重发。每一轮对话,客户端都把从第一句到现在的全部历史发给模型。第 1 轮你发 500 token,到第 10 轮,前面 9 轮的问答全在输入里,可能已经是 2 万 token。输入按 token 计费,同样一句追问,放在对话开头和放在对话尾巴上,价格能差几十倍。
计入上下文的东西比你想的多。系统提示、CLAUDE.md 这类固定说明、每个工具的定义、工具返回的结果、上传的图片、模型的思考过程,全都算。Claude Code 里跑一次 /context,很多人会发现自己还没提问,系统提示、工具定义和项目说明已经占了一块不小的空间。
上下文大本身不加价。Anthropic 定价文档写明,Claude 4.6 之后的模型 100 万上下文按标准价计费,一个 90 万 token 的请求和一个 9000 token 的请求,每 token 单价一样。OpenAI 的标准费率只适用于 272K 以内,超出部分怎么算要看它的详细定价页。真正让账单涨的是重发量,上下文越长,每一轮重发的就越多。
对话接近窗口上限时,Claude Code 会自动压缩,把前面的内容总结成一段再继续,效果和手动 /compact 一样。压缩之后系统提示、CLAUDE.md、记忆和 MCP 工具会重新加载,最近改过的文件最多重读 5 个,单个超过 5000 token 的只留路径。压缩本身是一次大请求,这笔钱省不掉,能省的是压缩之前那些没有必要的往返。
提示缓存是什么,能省多少钱
提示缓存是把每次请求里重复的那部分存起来,下一次直接读缓存,不重新处理。截至 2026 年 9 月,Anthropic 的缓存命中价是基础输入价的 0.1 倍,Fable 5.1 更低,是 0.025 倍;OpenAI 的缓存输入价也是标准输入价的 0.1 倍。
Anthropic 的规则写在提示缓存文档里。写入比普通输入贵一点,读取便宜很多。5 分钟档写一次读一次就回本,1 小时档要读两次才回本,这是定价页自己算的账。缓存每被读一次,有效期免费续一次,有效期从发起请求那一刻起算。
| 缓存操作 | 相对基础输入价 | 有效期 |
|---|---|---|
| 5 分钟缓存写入 | 1.25 倍 | 5 分钟 |
| 1 小时缓存写入 | 2 倍 | 1 小时 |
| 缓存命中 | 0.1 倍,Fable 5.1 与 Mythos 5.1 为 0.025 倍 | 与写入档一致,每次命中免费续期 |
太短的内容缓存不了。每个模型有最短可缓存长度,低于这个数的前缀不会被缓存,请求照常按普通输入计费。
| 模型 | 最短可缓存长度 |
|---|---|
| Fable 5.1、Mythos 5.1、Opus 5、Fable 5、Mythos 5 | 512 token |
| Opus 4.8、Sonnet 5、Sonnet 4.6、Sonnet 4.5、Opus 4.1、Opus 4、Sonnet 4 | 1,024 token |
| Opus 4.7、Mythos Preview、Haiku 3.5 | 2,048 token |
| Opus 4.6、Opus 4.5、Haiku 4.5 | 4,096 token |
能省多少,官方定价页给了一个算例。一次 Opus 5 会话有 5 万 token 输入,全部不走缓存是 0.25 美元;其中 4 万 token 命中缓存的话,1 万 token 按每百万 5 美元算 0.05 美元,4 万 token 按每百万 0.5 美元算 0.02 美元,输入这一项从 0.25 美元降到 0.07 美元。
再按官方单价算一个更常见的场景。一份 5000 token 的系统提示加 CLAUDE.md,在 Opus 5 上不缓存每次 2.5 美分,缓存命中后每次 0.25 美分,第一次写入多付 25%,从第二次起每次省九成。这 5000 token 一天被重发 200 次,差价就是 4.5 美元。
Claude Code 默认就把缓存用上了。每一轮把整段对话重发时,前面没变的部分按缓存价重读。Claude Code 成本文档写明,订阅账号的缓存有效期是 1 小时,开了用量额度或者用 API key 时是 5 分钟。中途离开超过有效期再回来,第一条消息会比平时贵一些,因为前面的内容要重新写一遍缓存。
顺带一句,不少低价 API 中转站的价目表上根本没有缓存命中这一行,账单看着打了七折,跑一天下来未必比官方便宜,这笔账放在AI 中转站靠谱吗那篇单独算。
订阅套餐和 API 按量付费怎么选
订阅是每月固定付费换一个用量额度,API 是用多少付多少。截至 2026 年 9 月,Claude Pro 月付 20 美元,年付 200 美元折合每月 17 美元,Max 从每月 100 美元起;ChatGPT Plus 月付 20 美元,Pro 有 100 美元和 200 美元两档。
两家有一条共同的规矩,订阅不含 API。OpenAI 定价页的 FAQ 直接写了 API 与 ChatGPT Plus、Business 分开计费,Anthropic 的 API 也要在 Console 单独充值,两边各付各的。
Claude 的档位如下,数据来自 Claude 定价页,核对日期 2026 年 9 月 14 日,价格单位美元。
| 档位 | 价格 | Claude Code 与 Cowork | 用量 | 模型 |
|---|---|---|---|---|
| Free | 0 | 都不含 | 日常问答 | Sonnet、Haiku |
| Pro | 20/月,年付 200 折合 17/月 | 都含 | 每个 5 小时窗口至少是 Free 的 5 倍 | Opus、Sonnet、Haiku,Fable 要开用量额度 |
| Max | 100/月起 | 都含 | 选 Pro 的 5 倍或 20 倍,输出上限更高 | 全部 |
| Team 标准席 | 年付 20/席/月,月付 25 | 含 | 比 Pro 多 | 全部功能 |
| Team 高级席 | 年付 100/席/月,月付 125 | 含 | 标准席的 5 倍 | 全部功能 |
ChatGPT 的档位数据来自 OpenAI 帮助中心和 Codex 定价文档,同一天核对。每 5 小时的本地消息数是官方给的估算区间,按 GPT-6 Astra、GPT-5.6 Sol、Terra、Luna 的顺序列。
| 档位 | 价格 | 含 Codex | 每 5 小时本地消息估算 |
|---|---|---|---|
| Free | 0 | 含 | 官方未单列,以账号内用量提示为准 |
| Go | 8/月 | 含 | 官方未单列 |
| Plus | 20/月,只有月付 | 含 | Astra 5 到 45,Sol 10 到 100,Terra 25 到 200,Luna 250 到 2,000 |
| Pro 5x | 100/月 | 含 | Astra 25 到 225,Sol 50 到 500,Terra 125 到 1,000,Luna 1,250 到 10,000 |
| Pro 20x | 200/月,是否开放新订以定价页当天为准 | 含 | Astra 100 到 900,Sol 200 到 2,000,Terra 500 到 4,000,Luna 5,000 到 40,000 |
| Business 标准席 | 月付 25,年付 20,至少 2 席 | 含 | 同 Plus |
普通用户我建议先订一个月 Pro。Free 没有 Claude Code 和 Cowork,Pro 都有,20 美元买到的是每个五小时窗口至少 Free 的 5 倍用量。订完盯着用量页看一个月,经常碰上限再考虑 Max,从没碰过就退回 Free。和买机场一样,第一次先月付,年付 200 美元省下的 40 美元不值得先押。
开发者的账要用官方数据算。Claude Code 成本文档给了 API 计费的参考值,企业里平均每个开发者每个活跃日大约 13 美元,每月 150 到 250 美元,九成用户每个活跃日低于 30 美元。按这个量,天天用 Claude Code 的人订 Pro 或 Max 比走 API 便宜得多,代价是要受五小时窗口和每周上限的约束。
API 适合一个月只用几天的人,也适合要在脚本和 CI 里跑的场景,比如 claude --print。受不了额度用完要等几小时的人,还有一条中间路,Claude 的订阅到了上限可以按 API 价开用量额度(usage credits)继续,Anthropic 帮助中心写得很清楚,想严格控制在订阅额度内,弹出 API 额度选项时选拒绝就行。
还没有账号的,先回Claude 注册与下载和Codex 注册与下载两篇把账号办好,再回来对照这两张表选档位。
额度是怎么算的,五小时窗口和每周上限
Claude 所有档位的用量都按一个滚动的五小时窗口重置,付费档在这之上再加每周上限;Codex 同样有五小时窗口和每周窗口。两家都在设置里的用量页显示下一次重置时间,起算点以那里显示的为准,别自己推算。
Claude 定价页的原话是 “Every plan has usage limits that reset on a rolling five-hour session window, and paid plans add weekly limits on top.”。Pro 在每个窗口里至少是 Free 的 5 倍,Max 再是 Pro 的 5 倍或 20 倍。
网页和 Claude Code 扣的是同一个额度。Anthropic 帮助中心讲 Pro 和 Max 用 Claude Code 的文章写明,Pro 和 Max 的用量上限在 Claude 与 Claude Code 之间共享。下午让 Claude Code 重构了一下午代码,晚上网页版聊两句就撞上限,原因就在这里。
到上限有三条路,等窗口滚动恢复,升级档位,或者按 API 价开用量额度接着用。Claude Code 里输入 /usage 能看当前用量。Fable 在 Pro 档要开用量额度才能用,Max 档的 Fable 用量另有上限,具体以订阅页当天的说明为准。
Codex 扣额度的口径来自官方定价文档。本地消息和云端任务共用额度,每周上限可能适用。官方给的每 5 小时消息数是很宽的区间,同一个档位在 GPT-6 Astra 上是 5 到 45 条,在 Luna 上是 250 到 2000 条。区间这么宽,因为一条消息带多少上下文差别极大,具体到你自己的用法,只能看用量页。
OpenAI 帮助中心 9 月更新的 banked resets 说明顺带确认了 Codex 仍然是五小时加每周两层窗口。banked reset 是存在账号里的一次性重置,用掉或者过期为止,它不是充值额度,也不会永久提高套餐上限。
这东西是促销福利,官方在推荐计划和新模型上线活动里发放,Codex 定价文档写明发放后 30 天内有效。GPT-6 Astra 上线前后官方给付费账号发过几次,具体日期以帮助中心那篇文章为准。用法在设置里的 Usage 页,桌面版、CLI 和网页都有,看到 “1 reset available” 或 “Full reset” 就点进去确认。
用掉一次完整重置会同时刷新五小时窗口和每周窗口,每周重置日期也会跟着变。过期的重置不会补发,客服也不提供人情重置,这两条帮助文章写得很硬。
怎么少花钱,普通用户几招、开发者几招
省钱只有两个方向,少往上下文里塞东西,以及让能缓存的部分保持不变。下面按网页版用户和 Claude Code 用户分开,每条都带原因,做法全部来自官方文档和上面算过的账。
普通用户,网页版和桌面版
| 做法 | 为什么省 |
|---|---|
| 一个话题一个对话,聊完就开新的 | 每一轮都重发全部历史,一个聊了 50 轮的对话,最后几句每条都拖着前面几万 token |
| 附件先删减再上传 | 官方示例里一份 500 kB 的 PDF 约 125,000 token,网页版窗口 20 万,一份文件占去大半,之后每轮都重发;只贴需要的章节 |
| 固定资料放进项目功能 | Pro 的 Projects 不限数量,资料放进项目知识,不用在每个对话里重新上传,也不会忘了传在哪个对话 |
| 简单问题关掉扩展思考,选轻一点的模型 | 思考按输出 token 计费,网页版怎么折算没有公开,日常问答 Sonnet 够用,Opus 留给复杂任务 |
| 到上限先等,不急着开用量额度 | 五小时窗口会滚动恢复;用量额度按 API 价另计,弹出时可以拒绝 |
| 常规任务交给国产模型 | 翻译、润色、日常问答这类活不必消耗海外额度,哪些能替代看国产 AI 能替代到什么程度 |
开发者,Claude Code 和 Codex
下面的命令和数字来自 Claude Code 成本文档,核对日期 2026 年 9 月 14 日。
| 做法 | 为什么省 |
|---|---|
切任务先 /clear |
不花钱;旧任务的上下文对新任务是纯成本,每一轮都跟着重发 |
长任务中途 /compact,可以带指令 |
压缩后只留摘要继续;压缩本身是一次大请求,先用 /context 看占用再决定,别每几分钟压一次 |
用 /autocompact 500k 这类设置调低自动压缩触发点 |
100 万上下文不加价,但每轮重发量跟着上下文长度走,触发点越高,压缩前那几轮越贵 |
按任务分级选模型,/model 切换 |
多数任务用 Sonnet,复杂才切 Opus,子代理设 model: haiku;Sonnet 5 每百万 2 和 10 美元,Opus 5 是 5 和 25,Fable 5.1 是 10 和 50 |
| CLAUDE.md 控制在 200 行以内 | 每次会话加载,每次压缩后重载;写规则不写教程,@ 导入只放必要文件 |
| 提示词写具体,不让它读整个仓库 | 指名文件和目录;冗长的搜索交给子代理,子代理有独立上下文,回到主对话的只有一段结果 |
/mcp 关掉不用的服务器 |
每个工具的定义都计入每一轮输入;能用 gh、aws 命令行的就少接 MCP |
/effort 调低扩展思考 |
思考按输出价计费 |
| 复杂任务先进 plan mode | 先出计划再动文件,少走回头路 |
| 会话中途别离开超过缓存有效期 | 订阅 1 小时,API key 5 分钟,超时后第一条消息要重新写入缓存 |
| agent teams 只用在真并行的任务上 | 官方给的口径是大约 7 倍 token |
| 离线批量任务走 Batch API | 输入输出各打五折,两家都有 |
Codex 的省法大同小异。它读的是 AGENTS.md,多层合并后上限 32 KiB,同样别写成长文档;/model 换模型,推理力度从 Low 到 Max 可选,默认 Medium,简单任务没必要往上调。
省下来的额度多半会花在下一件事上,给 Claude Code 和 Codex 装 Skills 和智能体。Skill 的正文只在被调用时才进入上下文,装多少不直接费 token,装什么、从哪装、怎么审,下一篇Skills 与智能体怎么装接着讲。
常见问题
一个 token 等于几个汉字?
为什么输出 token 比输入贵?
订阅套餐和 API 按量付费哪个更划算?
Claude Pro 和 Max 的用量在网页版和 Claude Code 之间共用吗?
提示缓存能省多少钱?
Codex 还有五小时窗口吗,banked reset 是什么?
Claude Code 怎么省 token?
发现信息过期或错误?欢迎联系纠错,我会尽快复核更新。