一段中文,大概要花多少 token?

把文字贴进下面的框,立刻看到字符数、词数和大概的 token 数——好判断它会不会超出 ChatGPT、Claude 这类工具一次能读的上限。

0字符(含空格)
0字符(不含空格)
0中文字
0英文/数字词
0估算 token(约)

这里给的是估算值,不是精确数。每家模型的分词方式不同,同一段话在 GPT、Claude、Gemini 上的真实 token 数会有出入,正负一两成都正常。要精确数字,用各家官方的 tokenizer 工具核对。

这个数字拿来干嘛?

你大概遇到过这种情况:把一大段资料丢给 AI,它要么回得驴唇不对马嘴,要么直接提示"太长了"。原因往往是超过了它一次能读进去的上限——这个上限就是用 token 来算的,不是用字数。

token 可以粗略理解成 AI 眼里的"词块"。英文里一个常见单词差不多就是 1 个 token,长一点的词会被拆成两三块;中文更费,一个汉字常常顶 1 到 2 个 token。所以同样"看着不长"的一段中文,吃掉的 token 往往比你以为的多。知道大概数字,就能提前判断:这份资料要不要分批喂、要不要先精简。

中文为什么比英文更"费 token"

模型的分词表是拿海量文本训练出来的,英文语料多、规律强,一个词往往能整块对应一个 token;中文字形多、组合杂,很多字得单独成块,甚至一个字拆成两块。结果就是:同样表达一个意思,中文消耗的 token 通常比英文多。这也是为什么有人把长中文文档翻成英文再喂给 AI——不是为了语言,是为了省 token、把更多内容塞进一次对话。

顺带一提,token 还直接关系到花多少钱:按量付费的接口就是按 token 计费,输入和输出都算。日常聊天感觉不到,但你要批量处理文档,token 的多少就是真金白银。想算一笔订阅账,可以用 AI 订阅成本计算器

怎么判断"会不会超"

不同模型一次能读的 token 上限差很多,从几千到上百万都有,而且一直在更新。用法很简单:把你打算一次性喂进去的全部内容(你的提问 + 贴进去的资料)都放进上面的框,看估算的 token 数,再去对照你用的那款模型当前的上下文上限。如果估算值已经接近上限,就别指望它能读全——该分批喂,或者先把资料精简一遍。

一个省心的习惯:真要塞长文档,与其纠结精确 token,不如先问自己"这里面哪些是 AI 真正需要的"。把无关的目录、版权页、重复段落删掉,常常比换工具更管用。怎么把要求讲清楚,见 提示词怎么写

常见问题

这个估算准吗?

只能当大概参考。真实 token 数取决于具体模型的分词器,这里用的是按中文字、英文词、其它字符分别加权的经验公式,和官方数字会有正负一两成的差距。判断"长不长、要不要分批"够用;要精确计费数字,请用各模型官方的 tokenizer。

我贴进去的文字会被上传或保存吗?

不会。计算全部在你自己的浏览器里完成,页面没有把内容发到任何服务器,也不写入本地存储。关掉页面就没了。即便如此,公司机密和他人隐私仍建议谨慎处理。

token 和字数到底什么关系?

没有固定换算。粗略说,英文大约 4 个字符≈1 token,中文大约 1 个字≈1~2 token。所以同样字数,中文的 token 通常更多。这也是上面把"字符数"和"估算 token"分开列的原因。

这个工具只做本地估算,不构成专业建议。各模型的上下文上限、分词方式和计费规则随时可能调整,请以你所用工具的官方说明为准。