Token 计算器

在线计算 token 数:用 OpenAI o200k_base、cl100k_base 与 DeepSeek 官方分词规则在浏览器里精确计数,逐个查看切分,按官方价格估算 GPT、Claude、Gemini、DeepSeek 费用。

  • 在浏览器中处理
  • 数据不离开你的设备
  • 免费 · 无需注册
粘贴纯文本、prompt 或代码,数量随输入更新;修改或清空会终止上一轮计算。角色标记、工具定义、图片和 PDF 不在计数范围内。
打开不超过 20 MB 的 UTF-8 文本文件,读取成功后替换输入。继续输入、点「示例」或「清空」会作废尚未完成的文件读取。
填写预计生成的输出 token 数,用于估算每次请求的输出和合计费用。本工具不会生成回答,标准价格不含批量与缓存折扣。
选择分词器查看前 2,000 个 token,尚未加载时会一并加载词表。「显示 token id」在方框内加上数字编号,总计数仍包含全部 token。

输入或粘贴文本,数量随输入实时更新。

分词器词表按需从本站加载,输入文字留在浏览器内。

— 个 token (o200k_base) o200k_base 自动计数。在 DeepSeek V4 或 cl100k_base 卡片上点「计算」加载对应词表(0.5 MB 或 0.4 MB);加载失败后出现「重试」。各计数遵循对应分词器公开的规则。 0 字符 0 UTF-8 字节 0 词 0 行

o200k_base

精确

— 个 token

GPT-5.5、GPT-5.4、GPT-4.1、GPT-4o、o3、o4-mini

DeepSeek V4

精确

— 个 token

deepseek-flash、deepseek-v4-pro

cl100k_base

精确

— 个 token

GPT-4、GPT-3.5 Turbo、text-embedding-3

Claude、Gemini、GPT-6

无本地分词器

这些模型没有公开可在本地运行的分词器,精确数量请用厂商免费的 token 计数接口获取。下表对它们用 o200k_base 的数量作粗略参考。

各模型费用

模型 输入 token 上下文占用 输入 输出 合计

≈ 表示用 o200k_base 的数量作参考。这些模型使用各自的分词器,实际数量不同。Anthropic 说明 Claude 4.7 及以后的模型对同一段文本约多产生 30% 的 token。

Token 切分

每个方框是一个 token。⟨⟩ 中是只占半个字符的字节,下一个 token 补齐这个字符。

阅读完整使用指南 大模型的 Token 是什么:分词器怎样数你的文字
示例、说明与常见问题 带实际输出的示例、与同类工具的差别,以及常见问题。

DeepSeek:按字数估算和精确计数差多少

DeepSeek 的 Token 用量计算文档给出两条经验值:1 个英文字符约 0.3 个 token,1 个中文字符约 0.6 个 token,并提供离线计算的分词器压缩包。本工具的 DeepSeek V4 卡片就是用这个压缩包里的 tokenizer.json 生成的,计数与官方分词器一致。

例如「请用三句话总结下面这份周报,并列出风险项。」共 21 个字符,其中 19 个汉字。按 0.6 估算约 11 个 token,实际是 15 个;同一句话在 o200k_base 下是 16 个,在 GPT-4 用的 cl100k_base 下是 23 个。

页面的「示例」按钮会填入一段 192 个字符的中英混排评审请求:

分词器token 数每个 token 对应字符数
DeepSeek V41111.73
o200k_base(GPT-5.x、GPT-4o)1331.44
cl100k_base(GPT-4、GPT-3.5)1721.12

中文文本在 DeepSeek 下最省,在旧的 cl100k_base 下最费:同一段话 cl100k_base 比 DeepSeek 多 55%。比较不同厂商的价格时,要先用各自的分词器数一遍,再乘单价。

人民币价格与高峰时段

DeepSeek 的中文价格页按人民币计价,与英文页的美元价格分别定价。2026 年 10 月 1 日核对的标准价格(缓存未命中)如下:

模型输入(每百万 token)输出(每百万 token)
deepseek-flash(DeepSeek-V4.1-Flash)2 元8 元
deepseek-v4-pro9 元27 元

以上是高峰时段价格。北京时间周一至周五(不含法定节假日)9:00–12:00、14:00–18:00 为高峰,其余时段为空闲,价格减半。中文页面的表格在 DeepSeek 行同时给出美元和人民币、高峰和空闲两组费用。其他模型只有美元价格,没有换算汇率。

哪些模型能精确计数

  • o200k_base:GPT-5.x、GPT-4.1、GPT-4o、o1、o3、o4-mini。依据是 OpenAI tiktoken 的模型对照表。
  • cl100k_base:GPT-4、GPT-3.5 Turbo,以及 向量模型文档指定的 text-embedding-3 系列。做 RAG 分块时用它算 8,192 的输入上限。
  • DeepSeek V4:deepseek-flash、deepseek-v4-pro。
  • Claude、Gemini、GPT-6:没有公开本地分词器。Anthropic 的计数接口免费,但文档自己也说结果是估算;它还说明 Claude 4.7 及以后的模型对同一段文本约多 30% 的 token。Google 的说明只给出「约 4 个字符一个 token」。表格对它们用 o200k_base 数量作参考,标 ≈。

通义千问、豆包、Kimi、GLM 等国内模型各有自己的词表,本工具不计算它们,请以各平台返回的 usage 为准。

和同类工具的差别

2026 年 10 月 1 日,用上面那句 56 个字符的「你是一名资深后端工程师……」实测(o200k_base 35 个,DeepSeek V4 26 个):

  • DevTk.AI 的 AI Token 计算器:GPT 模型给出 35,标注 Exact,正确;没有 DeepSeek 的精确计数。
  • benchlm.ai:输入框下显示「~14 tokens」,Claude、Gemini、DeepSeek 各行都是 14,大约是字符数除以 4,只有实际数量(35 和 26)的 40% 到 54%。
  • tokencost.app:DeepSeek V4.1 Flash 显示「42~」,比实际多 62%;价格列用的是空闲时段价格。

本页旧版本使用 js-tiktoken。它在没有空格的长段文字上合并很慢,2 万个连续汉字要算 3 分钟以上;新版本改用优先队列合并,同样的输入只要几毫秒。

限制

字符统计、预分词与 token 计算在 Web Worker 中完成。修改或清空输入会终止上一轮计算;页面只接收统计、完整计数和前 2,000 个 token 的展示数据。大文本在输入框中的排版仍可能耗时:我们的测试(Apple M1 Max,Chromium 152,2026-10-03)中,100 万字中英混排文本放进输入框用了 1~2 秒,之后 o200k_base 计数约 1.1~1.9 秒。

  • 只计算纯文本。消息格式、system 提示、工具定义、图片和文件带来的 token 只有厂商接口能算。
  • <|endoftext|> 这类 OpenAI 特殊标记按普通文本计算(7 个 token),与 tiktoken 的 encode_ordinary 一致;DeepSeek 自己的标记如 <|User|> 按官方 tokenizer.json 计为 1 个。
  • Claude、Gemini、GPT-6 的行只是参考值。
  • DeepSeek 压缩包的示例脚本用 transformers 加载。我们实测 transformers 5.18.0 对这个包里的中文文本返回空列表,4.57.6 和 tokenizers 库返回的结果与本页一致。离线脚本请固定 transformers 4.x,或直接用 tokenizers。
  • 价格是 2026 年 10 月 1 日的快照,不含税费与协议折扣。

相关工具:用 字数统计工具看字符和词数,把 prompt 发给模型前用 API Key 脱敏工具去掉密钥,用 JSONL 转换器整理批量请求文件。

FAQ

哪些数字是精确的?

o200k_base、cl100k_base 和 DeepSeek V4 三张卡片是精确值。工具使用与 OpenAI tiktoken、DeepSeek 官方 tokenizer.json 相同的词表和合并规则,测试脚本在 1,500 多段文本上逐个比对 token id。Claude、Gemini、GPT-6 没有公开可在本地运行的分词器,表格里这几行用 o200k_base 的数量作参考,并标 ≈。

为什么和接口返回的 usage 对不上?

工具只计算一段纯文本。真实请求里还有角色标记、system 提示、工具定义、图片和文件。OpenAI 文档说明它的计数接口包含这些格式 token,本地分词器看不到。只粘贴要比较的那段文字,或用厂商的计数接口传入完整请求。

文本会被上传吗?

不会。计算在浏览器的 Web Worker 中完成。分词器词表是本站的静态文件,按需加载;终止旧任务后,下一次计算可能重新读取词表。请求不含输入文字,可以在浏览器开发者工具的 Network 面板里确认。

DeepSeek 文档说 1 个汉字约 0.6 个 token,为什么这里不一样?

那是 DeepSeek 给出的粗略换算,文档也写明以接口返回为准。本工具直接运行 DeepSeek 离线计数包里的分词规则,结果与官方 tokenizer.json 一致。常用词组会合并成一个 token,所以实际数量常常低于按字数估算的值。

价格是什么时候的?

2026 年 10 月 1 日在 OpenAI、Anthropic、Google、DeepSeek 官方价格页核对,日期写在表格下方。中文页面的 DeepSeek 行另外显示 DeepSeek 中文价格页的人民币价格。价格会调整,做预算前请打开原页面再确认。