刚注册完 Claude 或 ChatGPT 的人,第一个绕不开的问题是要不要花 20 美元订 Pro,订完以后第二个问题往往是,为什么聊着聊着就提示用量到了上限。两个问题背后是同一个东西,token。这篇是AI 工具攻略系列的第 4 篇,上一篇比较了桌面版和网页版的区别,这一篇只讲钱怎么算、额度怎么扣、怎么少花。看这篇不需要任何基础,会加减乘除就够。

token 是大语言模型读写文字的最小计量单位。你发给 Claude、ChatGPT 的每句话,它们回给你的每个字,都先被切成 token,再按 token 数量计费或者扣用量额度。Anthropic 的术语表说一个 token 大约对应 3.5 个英文字符,OpenAI 的帮助文档说大约 4 个英文字符或 0.75 个英文单词,两家都没有给出中文的官方换算。

本文核验时的版本。截至 2026 年 9 月 14 日,我把 Anthropic 的模型定价页、提示缓存文档、Claude 订阅页、Claude Code 成本文档,以及 OpenAI 的 API 定价页和 Codex 帮助文章各对了一遍。

Claude 这边的现行模型是 Fable 5.1、Opus 5、Sonnet 5 和 Haiku 4.5,OpenAI 这边是 GPT-6 Astra 和 GPT-5.6 的 Sol、Terra、Luna 三档。模型名换得很快,文里所有价格都以这一天的官方页为准。

token 是什么意思,一个 token 等于几个汉字

token 是分词器把文字切开之后的最小单位,可以是一个完整的英文单词、半个单词、一个标点,也可以是一两个汉字。模型不认字,它认的是每个 token 对应的编号,算的是编号之间的概率。

汉字换算只有实测口径。我 9 月 14 日在 OpenAI 的 Tokenizer 页面贴了两段中文,59 个汉字算出 37 个 token,108 个汉字算出 70 个 token,折下来每个汉字大约 0.65 个 token,也就是 1 个 token 约等于 1.5 个汉字。这是单次样本,换一段标点多、生僻字多的文字,数字会变。

分词器的版本也会改数字。Anthropic 定价页注明,Claude 4.7 及之后的模型换了新分词器,同样的文字大约多出 30% 的 token,Sonnet 4.6 及更早的模型用旧分词器。所以同一段中文,在 Sonnet 5 上和在 Sonnet 4.6 上算出来的 token 数不一样,网上流传的每字多少 token 的说法,先看它是用哪个分词器量的。

下面这张换算表的数据来自 Anthropic 定价页、OpenAI 帮助文档和上面那次实测,核对日期 2026 年 9 月 14 日,全部是大约值。

内容 大约多少 token 依据
1000 个英文字符 250 到 290 Anthropic 术语表 3.5 字符一个 token,定价页 FAQ 4 字符一个 token
1000 个英文单词 约 1330 两家都写 0.75 个单词一个 token
1000 个汉字 约 650 到 700 OpenAI Tokenizer 页两段样本,0.65 token 一个汉字
同一段文字换到 Claude 4.7 及之后的模型 再多约 30% Anthropic 定价页分词器说明
一个 10 kB 的普通网页 约 2,500 Anthropic 定价页 web fetch 示例
一份 500 kB 的论文 PDF 约 125,000 同上
代码 无官方口径,符号、缩进和换行都占 token,按字符数算通常比英文散文更费 建议实测

要精确数字就别估,两家都有免费工具。OpenAI 的 Tokenizer 页面贴进去就出结果,Anthropic 有一个免费的 token 计数接口POST /v1/messages/count_tokens,返回的是估算值但不收费。Claude Code 里输入 /context 能看到当前对话占了多少。

模型、上下文和生成,三个词就够用

模型是一大堆参数,它只做一件事,看着前面所有 token,算下一个 token 最可能是什么。上下文是它这一次能看到的全部内容,系统提示、你之前说的话、上传的文件、工具返回的结果都在里面,也包括它自己正在写的回答。生成是一个 token 一个 token 往外写,每写一个,就接到上下文末尾,再算下一个。

模型本身在两次请求之间什么都不保存。网页版的对话历史和记忆功能,都是产品在模型外面另存了一份,下一次请求时再塞回上下文。这一点决定了后面所有的价格问题,每一轮都是同一个模型把整段历史重新读一遍。

AI 是怎么算钱的,输入和输出为什么价格不同

AI 按 token 数量计费,输入和输出分开算。2026 年 9 月的官方价,Claude 现行四个模型的输出单价都是输入的 5 倍,OpenAI 的 GPT-6 Astra 也是 5 倍,GPT-5.6 Terra 和 Luna 是 6 倍。

输入是你发过去的全部内容,输出是模型写回来的内容。API 账单上这两项分开列,订阅用户看不到账单,但用量额度按同样的思路扣。

输出贵,定价页不解释原因,从生成方式上能看出来。输入可以一次并行读完,几万 token 的文档过一遍就算完了。输出做不到,每个 token 都要把整个模型完整跑一遍,写 1000 个 token 就是跑 1000 遍,中间还得一直占着算力等你这个请求写完。

还有一类你看不见的 token。OpenAI 把模型的推理过程记作 reasoning token,用户看不到内容,账单上按输出价收;Anthropic 的扩展思考同样按输出 token 计费。开了深度思考问一个简单问题,账单会比回答本身的长度高出不少。

Claude 的 API 单价如下,数据来自 Anthropic 定价文档,单位是美元每百万 token,核对日期 2026 年 9 月 14 日。Sonnet 5 的 2 美元和 10 美元原本是介绍价,官方已经改为长期标准价。

模型 基础输入 5 分钟缓存写入 1 小时缓存写入 缓存命中 输出
Claude Fable 5.1 $10 $12.50 $20 $0.25 $50
Claude Opus 5 $5 $6.25 $10 $0.50 $25
Claude Sonnet 5 $2 $2.50 $4 $0.20 $10
Claude Haiku 4.5 $1 $1.25 $2 $0.10 $5

OpenAI 的单价来自 OpenAI API 定价页,同样是美元每百万 token,同一天核对。定价页注明这些是 272K 上下文以内的标准费率。

模型 输入 缓存输入 输出
GPT-6 Astra $10 $1 $50
GPT-5.6 Sol,促销价至少到 2026 年 11 月 21 日 $4,原价 $5 $0.40,原价 $0.50 $20,原价 $30
GPT-5.6 Terra $2 $0.20 $12
GPT-5.6 Luna $0.20 $0.02 $1.20

拿 Sonnet 5 算一笔。贴一份 1 万汉字的文档让它总结,按上面的换算输入大约 6500 到 8500 token,不到 2 美分;它回 500 字,输出 300 多 token,不到 1 美分。单看一次很便宜,贵在后面,同一份文档每多问一句,它都要把文档重读一遍。

两家都有一个五折通道。不着急要结果的任务走 Batch API,异步处理,输入和输出都打五折,Anthropic 和 OpenAI 的规则一样。写脚本批量处理文档的开发者应该先看这一项。

上下文窗口是什么,为什么越聊越贵

上下文窗口是模型一次请求能看到的内容上限,Anthropic 的定义是模型生成回答时能引用的全部文本,包括回答本身。截至 2026 年 9 月,Fable 5.1、Opus 5、Sonnet 5 在 API 上都是 100 万 token,claude.ai 网页版四个档位都是 20 万。

越聊越贵的原因就是前面说的重发。每一轮对话,客户端都把从第一句到现在的全部历史发给模型。第 1 轮你发 500 token,到第 10 轮,前面 9 轮的问答全在输入里,可能已经是 2 万 token。输入按 token 计费,同样一句追问,放在对话开头和放在对话尾巴上,价格能差几十倍。

计入上下文的东西比你想的多。系统提示、CLAUDE.md 这类固定说明、每个工具的定义、工具返回的结果、上传的图片、模型的思考过程,全都算。Claude Code 里跑一次 /context,很多人会发现自己还没提问,系统提示、工具定义和项目说明已经占了一块不小的空间。

上下文大本身不加价。Anthropic 定价文档写明,Claude 4.6 之后的模型 100 万上下文按标准价计费,一个 90 万 token 的请求和一个 9000 token 的请求,每 token 单价一样。OpenAI 的标准费率只适用于 272K 以内,超出部分怎么算要看它的详细定价页。真正让账单涨的是重发量,上下文越长,每一轮重发的就越多。

对话接近窗口上限时,Claude Code 会自动压缩,把前面的内容总结成一段再继续,效果和手动 /compact 一样。压缩之后系统提示、CLAUDE.md、记忆和 MCP 工具会重新加载,最近改过的文件最多重读 5 个,单个超过 5000 token 的只留路径。压缩本身是一次大请求,这笔钱省不掉,能省的是压缩之前那些没有必要的往返。

提示缓存是什么,能省多少钱

提示缓存是把每次请求里重复的那部分存起来,下一次直接读缓存,不重新处理。截至 2026 年 9 月,Anthropic 的缓存命中价是基础输入价的 0.1 倍,Fable 5.1 更低,是 0.025 倍;OpenAI 的缓存输入价也是标准输入价的 0.1 倍。

Anthropic 的规则写在提示缓存文档里。写入比普通输入贵一点,读取便宜很多。5 分钟档写一次读一次就回本,1 小时档要读两次才回本,这是定价页自己算的账。缓存每被读一次,有效期免费续一次,有效期从发起请求那一刻起算。

缓存操作 相对基础输入价 有效期
5 分钟缓存写入 1.25 倍 5 分钟
1 小时缓存写入 2 倍 1 小时
缓存命中 0.1 倍,Fable 5.1 与 Mythos 5.1 为 0.025 倍 与写入档一致,每次命中免费续期

太短的内容缓存不了。每个模型有最短可缓存长度,低于这个数的前缀不会被缓存,请求照常按普通输入计费。

模型 最短可缓存长度
Fable 5.1、Mythos 5.1、Opus 5、Fable 5、Mythos 5 512 token
Opus 4.8、Sonnet 5、Sonnet 4.6、Sonnet 4.5、Opus 4.1、Opus 4、Sonnet 4 1,024 token
Opus 4.7、Mythos Preview、Haiku 3.5 2,048 token
Opus 4.6、Opus 4.5、Haiku 4.5 4,096 token

能省多少,官方定价页给了一个算例。一次 Opus 5 会话有 5 万 token 输入,全部不走缓存是 0.25 美元;其中 4 万 token 命中缓存的话,1 万 token 按每百万 5 美元算 0.05 美元,4 万 token 按每百万 0.5 美元算 0.02 美元,输入这一项从 0.25 美元降到 0.07 美元。

再按官方单价算一个更常见的场景。一份 5000 token 的系统提示加 CLAUDE.md,在 Opus 5 上不缓存每次 2.5 美分,缓存命中后每次 0.25 美分,第一次写入多付 25%,从第二次起每次省九成。这 5000 token 一天被重发 200 次,差价就是 4.5 美元。

Claude Code 默认就把缓存用上了。每一轮把整段对话重发时,前面没变的部分按缓存价重读。Claude Code 成本文档写明,订阅账号的缓存有效期是 1 小时,开了用量额度或者用 API key 时是 5 分钟。中途离开超过有效期再回来,第一条消息会比平时贵一些,因为前面的内容要重新写一遍缓存。

顺带一句,不少低价 API 中转站的价目表上根本没有缓存命中这一行,账单看着打了七折,跑一天下来未必比官方便宜,这笔账放在AI 中转站靠谱吗那篇单独算。

订阅套餐和 API 按量付费怎么选

订阅是每月固定付费换一个用量额度,API 是用多少付多少。截至 2026 年 9 月,Claude Pro 月付 20 美元,年付 200 美元折合每月 17 美元,Max 从每月 100 美元起;ChatGPT Plus 月付 20 美元,Pro 有 100 美元和 200 美元两档。

两家有一条共同的规矩,订阅不含 API。OpenAI 定价页的 FAQ 直接写了 API 与 ChatGPT Plus、Business 分开计费,Anthropic 的 API 也要在 Console 单独充值,两边各付各的。

Claude 的档位如下,数据来自 Claude 定价页,核对日期 2026 年 9 月 14 日,价格单位美元。

档位 价格 Claude Code 与 Cowork 用量 模型
Free 0 都不含 日常问答 Sonnet、Haiku
Pro 20/月,年付 200 折合 17/月 都含 每个 5 小时窗口至少是 Free 的 5 倍 Opus、Sonnet、Haiku,Fable 要开用量额度
Max 100/月起 都含 选 Pro 的 5 倍或 20 倍,输出上限更高 全部
Team 标准席 年付 20/席/月,月付 25 比 Pro 多 全部功能
Team 高级席 年付 100/席/月,月付 125 标准席的 5 倍 全部功能

ChatGPT 的档位数据来自 OpenAI 帮助中心和 Codex 定价文档,同一天核对。每 5 小时的本地消息数是官方给的估算区间,按 GPT-6 Astra、GPT-5.6 Sol、Terra、Luna 的顺序列。

档位 价格 含 Codex 每 5 小时本地消息估算
Free 0 官方未单列,以账号内用量提示为准
Go 8/月 官方未单列
Plus 20/月,只有月付 Astra 5 到 45,Sol 10 到 100,Terra 25 到 200,Luna 250 到 2,000
Pro 5x 100/月 Astra 25 到 225,Sol 50 到 500,Terra 125 到 1,000,Luna 1,250 到 10,000
Pro 20x 200/月,是否开放新订以定价页当天为准 Astra 100 到 900,Sol 200 到 2,000,Terra 500 到 4,000,Luna 5,000 到 40,000
Business 标准席 月付 25,年付 20,至少 2 席 同 Plus

普通用户我建议先订一个月 Pro。Free 没有 Claude Code 和 Cowork,Pro 都有,20 美元买到的是每个五小时窗口至少 Free 的 5 倍用量。订完盯着用量页看一个月,经常碰上限再考虑 Max,从没碰过就退回 Free。和买机场一样,第一次先月付,年付 200 美元省下的 40 美元不值得先押。

开发者的账要用官方数据算。Claude Code 成本文档给了 API 计费的参考值,企业里平均每个开发者每个活跃日大约 13 美元,每月 150 到 250 美元,九成用户每个活跃日低于 30 美元。按这个量,天天用 Claude Code 的人订 Pro 或 Max 比走 API 便宜得多,代价是要受五小时窗口和每周上限的约束。

API 适合一个月只用几天的人,也适合要在脚本和 CI 里跑的场景,比如 claude --print。受不了额度用完要等几小时的人,还有一条中间路,Claude 的订阅到了上限可以按 API 价开用量额度(usage credits)继续,Anthropic 帮助中心写得很清楚,想严格控制在订阅额度内,弹出 API 额度选项时选拒绝就行。

还没有账号的,先回Claude 注册与下载Codex 注册与下载两篇把账号办好,再回来对照这两张表选档位。

额度是怎么算的,五小时窗口和每周上限

Claude 所有档位的用量都按一个滚动的五小时窗口重置,付费档在这之上再加每周上限;Codex 同样有五小时窗口和每周窗口。两家都在设置里的用量页显示下一次重置时间,起算点以那里显示的为准,别自己推算。

Claude 定价页的原话是 “Every plan has usage limits that reset on a rolling five-hour session window, and paid plans add weekly limits on top.”。Pro 在每个窗口里至少是 Free 的 5 倍,Max 再是 Pro 的 5 倍或 20 倍。

网页和 Claude Code 扣的是同一个额度。Anthropic 帮助中心讲 Pro 和 Max 用 Claude Code 的文章写明,Pro 和 Max 的用量上限在 Claude 与 Claude Code 之间共享。下午让 Claude Code 重构了一下午代码,晚上网页版聊两句就撞上限,原因就在这里。

到上限有三条路,等窗口滚动恢复,升级档位,或者按 API 价开用量额度接着用。Claude Code 里输入 /usage 能看当前用量。Fable 在 Pro 档要开用量额度才能用,Max 档的 Fable 用量另有上限,具体以订阅页当天的说明为准。

Codex 扣额度的口径来自官方定价文档。本地消息和云端任务共用额度,每周上限可能适用。官方给的每 5 小时消息数是很宽的区间,同一个档位在 GPT-6 Astra 上是 5 到 45 条,在 Luna 上是 250 到 2000 条。区间这么宽,因为一条消息带多少上下文差别极大,具体到你自己的用法,只能看用量页。

OpenAI 帮助中心 9 月更新的 banked resets 说明顺带确认了 Codex 仍然是五小时加每周两层窗口。banked reset 是存在账号里的一次性重置,用掉或者过期为止,它不是充值额度,也不会永久提高套餐上限。

这东西是促销福利,官方在推荐计划和新模型上线活动里发放,Codex 定价文档写明发放后 30 天内有效。GPT-6 Astra 上线前后官方给付费账号发过几次,具体日期以帮助中心那篇文章为准。用法在设置里的 Usage 页,桌面版、CLI 和网页都有,看到 “1 reset available” 或 “Full reset” 就点进去确认。

用掉一次完整重置会同时刷新五小时窗口和每周窗口,每周重置日期也会跟着变。过期的重置不会补发,客服也不提供人情重置,这两条帮助文章写得很硬。

怎么少花钱,普通用户几招、开发者几招

省钱只有两个方向,少往上下文里塞东西,以及让能缓存的部分保持不变。下面按网页版用户和 Claude Code 用户分开,每条都带原因,做法全部来自官方文档和上面算过的账。

普通用户,网页版和桌面版

做法 为什么省
一个话题一个对话,聊完就开新的 每一轮都重发全部历史,一个聊了 50 轮的对话,最后几句每条都拖着前面几万 token
附件先删减再上传 官方示例里一份 500 kB 的 PDF 约 125,000 token,网页版窗口 20 万,一份文件占去大半,之后每轮都重发;只贴需要的章节
固定资料放进项目功能 Pro 的 Projects 不限数量,资料放进项目知识,不用在每个对话里重新上传,也不会忘了传在哪个对话
简单问题关掉扩展思考,选轻一点的模型 思考按输出 token 计费,网页版怎么折算没有公开,日常问答 Sonnet 够用,Opus 留给复杂任务
到上限先等,不急着开用量额度 五小时窗口会滚动恢复;用量额度按 API 价另计,弹出时可以拒绝
常规任务交给国产模型 翻译、润色、日常问答这类活不必消耗海外额度,哪些能替代看国产 AI 能替代到什么程度

开发者,Claude Code 和 Codex

下面的命令和数字来自 Claude Code 成本文档,核对日期 2026 年 9 月 14 日。

做法 为什么省
切任务先 /clear 不花钱;旧任务的上下文对新任务是纯成本,每一轮都跟着重发
长任务中途 /compact,可以带指令 压缩后只留摘要继续;压缩本身是一次大请求,先用 /context 看占用再决定,别每几分钟压一次
/autocompact 500k 这类设置调低自动压缩触发点 100 万上下文不加价,但每轮重发量跟着上下文长度走,触发点越高,压缩前那几轮越贵
按任务分级选模型,/model 切换 多数任务用 Sonnet,复杂才切 Opus,子代理设 model: haiku;Sonnet 5 每百万 2 和 10 美元,Opus 5 是 5 和 25,Fable 5.1 是 10 和 50
CLAUDE.md 控制在 200 行以内 每次会话加载,每次压缩后重载;写规则不写教程,@ 导入只放必要文件
提示词写具体,不让它读整个仓库 指名文件和目录;冗长的搜索交给子代理,子代理有独立上下文,回到主对话的只有一段结果
/mcp 关掉不用的服务器 每个工具的定义都计入每一轮输入;能用 ghaws 命令行的就少接 MCP
/effort 调低扩展思考 思考按输出价计费
复杂任务先进 plan mode 先出计划再动文件,少走回头路
会话中途别离开超过缓存有效期 订阅 1 小时,API key 5 分钟,超时后第一条消息要重新写入缓存
agent teams 只用在真并行的任务上 官方给的口径是大约 7 倍 token
离线批量任务走 Batch API 输入输出各打五折,两家都有

Codex 的省法大同小异。它读的是 AGENTS.md,多层合并后上限 32 KiB,同样别写成长文档;/model 换模型,推理力度从 Low 到 Max 可选,默认 Medium,简单任务没必要往上调。

省下来的额度多半会花在下一件事上,给 Claude Code 和 Codex 装 Skills 和智能体。Skill 的正文只在被调用时才进入上下文,装多少不直接费 token,装什么、从哪装、怎么审,下一篇Skills 与智能体怎么装接着讲。

常见问题

一个 token 等于几个汉字?
官方只给英文换算,一个 token 约 3.5 到 4 个英文字符或 0.75 个单词。2026 年 9 月在 OpenAI Tokenizer 页面实测,108 个汉字算出 70 个 token,约 1.5 个汉字一个 token;Claude 4.7 之后的新分词器还会多算约 30%。
为什么输出 token 比输入贵?
输入可以一次并行读完,输出要一个 token 一个 token 生成,每个都要把整个模型跑一遍。Claude Sonnet 5 每百万 token 输入 2 美元、输出 10 美元,GPT-6 Astra 是 10 美元和 50 美元,输出都是输入的 5 倍。思考过程也按输出计费。
订阅套餐和 API 按量付费哪个更划算?
每天都用 Claude Code 的人订阅更划算。官方统计 API 用户平均每个活跃日约 13 美元、每月 150 到 250 美元,而 Pro 月付 20 美元、Max 100 美元起。一个月只用几天、要跑脚本,或者不想受五小时窗口限制的人适合 API。两家的订阅都不含 API,要分开开通。
Claude Pro 和 Max 的用量在网页版和 Claude Code 之间共用吗?
共用。Anthropic 帮助中心写明 Pro 和 Max 的用量上限在 Claude 与 Claude Code 之间共享,两边的活动扣同一个额度。所有档位按滚动五小时窗口重置,付费档另加每周上限,到上限可以等待恢复、升级档位,或者按 API 价开用量额度继续。
提示缓存能省多少钱?
Anthropic 缓存命中按基础输入价的 0.1 倍计费,5 分钟缓存写入 1.25 倍,写一次读一次就回本。官方算例里 Opus 5 一次 5 万 token 输入有 4 万命中缓存,输入费用从 0.25 美元降到 0.07 美元。OpenAI 的缓存输入价同样是标准价的 0.1 倍。
Codex 还有五小时窗口吗,banked reset 是什么?
有。OpenAI 帮助中心 2026 年 9 月更新的文章写明,使用一次完整的 banked reset 会同时刷新 Codex 的 5 小时窗口和每周窗口。banked reset 是存在账号里的一次性重置,属于促销福利,会过期,不是充值额度,也不会提高套餐上限,在设置的 Usage 页使用。
Claude Code 怎么省 token?
切任务用 /clear,不花钱;长任务中途 /compact 并带上要保留的内容;多数任务用 Sonnet,复杂任务再切 Opus;CLAUDE.md 控制在 200 行内;用 /mcp 关掉不用的工具服务器;用 /context 看占用。这些做法都来自 Claude Code 官方成本文档。

发现信息过期或错误?欢迎联系纠错,我会尽快复核更新。