o200k_base
正確— トークン
GPT-5.5、GPT-5.4、GPT-4.1、GPT-4o、o3、o4-mini
OpenAI の o200k_base・cl100k_base と DeepSeek 公式の tokenizer でトークン数をブラウザ内で正確にカウント。分割結果の表示と、GPT・Claude・Gemini・DeepSeek の料金試算に対応。
WeChat でスキャンしてシェア
議事録の要約を頼む同じ意味の指示を、英語と日本語で数えました。
| テキスト | 文字数 | o200k_base | cl100k_base | DeepSeek V4 |
|---|---|---|---|---|
| Summarize the meeting notes below in three lines and list the decisions and action items. | 89 | 18 | 18 | 17 |
| 以下の議事録を3行で要約し、決定事項と宿題を箇条書きにしてください。 | 34 | 28 | 38 | 25 |
英語は 3 つの tokenizer でほぼ同じですが、日本語は cl100k_base が o200k_base より 36% 多くなります。GPT-4 から GPT-4o 以降に移ると、同じ日本語のプロンプトでも入力トークンが減るということです。
「サンプル」ボタンで入る 275 文字のレビュー依頼文では、次の結果になります。
ただし短い文では順位が入れ替わります。「こんにちは、世界」は o200k_base で 3、cl100k_base で 5、DeepSeek V4 で 7 トークンです。DeepSeek の tokenizer は漢字・ひらがな・カタカナが続く部分を先に 1 つのまとまりとして切り出してから分割するため、よく使われるあいさつでも複数のトークンに分かれます。少数の例から「どのモデルが安いか」を決めず、実際の文章で数えるのが確実です。
| カード | 対象モデル | 根拠 |
|---|---|---|
| o200k_base | GPT-5.x、GPT-4.1、GPT-4o、o1、o3、o4-mini | OpenAI の tiktoken のモデル対応表 |
| cl100k_base | GPT-4、GPT-3.5 Turbo、text-embedding-3 | 同じ対応表と Embeddings ガイド |
| DeepSeek V4 | deepseek-flash、deepseek-v4-pro | DeepSeek のオフライン計算パッケージに入っている tokenizer.json |
| ≈ 目安 | Claude、Gemini、GPT-6 | ローカル用 tokenizer は非公開。o200k_base の数で代用 |
Claude は Anthropic のトークン数カウント API(無料)で数えられますが、ドキュメント自身が結果を推定値としています。また Claude 4.7 以降は、同じテキストで以前の Claude より約 30% 多くトークンを数えると明記しています。Gemini は Google の説明で「1 トークンは約 4 文字」とされるだけなので、正確な数は countTokens で確認してください。
単価は 2026 年 10 月 1 日に確認した標準料金(バッチ割引・キャッシュなし)で、すべて米ドルです。長い入力で単価が上がるモデルは自動で切り替えます。gpt-5.5 と GPT-6 は入力 272,000 トークン超、gemini-3.1-pro-preview は 200,000 トークン超です。DeepSeek はオフピーク(日本時間で平日 10 時〜13 時と 15 時〜19 時以外)が半額で、両方の金額を表示します。
2026 年 10 月 1 日、レビュー依頼文の 1 文目(80 文字、o200k_base 44、cl100k_base 56、DeepSeek V4 45 トークン)で確認しました。
このページの旧版は js-tiktoken を使っていました。js-tiktoken は空白のない長い文字列でマージ処理が極端に遅く、漢字 2 万字の連続で 3 分以上かかりました。新版は優先度付きキューでマージし、同じ入力を数ミリ秒で処理します。また BOM(U+FEFF)を含むテキストでも tiktoken と同じ位置で区切ります。
文字の統計、事前分割、トークン計算は Web Worker で行います。入力を編集または消去すると前の計算を終了します。ページには統計、全体の数、先頭 2,000 トークンの表示データだけを返します。大きなテキストの入力欄への描画には時間がかかる場合があります。当サイトのテスト(Apple M1 Max、Chromium 152、2026-10-03)では、中国語と英語が混ざった 100 万文字を入力欄に表示するのに 1~2 秒、その後 o200k_base でのカウントに約 1.1~1.9 秒かかりました。
<|endoftext|> などの OpenAI の特殊トークンは普通の文字列として数えます(7 トークン)。tiktoken の encode_ordinary と同じです。DeepSeek の <|User|> などは公式 tokenizer.json に従い 1 トークンです。関連ツール:文字数や単語数は単語・文字数カウンター、プロンプトに API キーが残っていないかはAPIキーマスキング、バッチ用のファイルは JSONL コンバーターで扱えます。
o200k_base、cl100k_base、DeepSeek V4 の 3 枚のカードです。OpenAI の tiktoken、DeepSeek 公式の tokenizer.json と同じ語彙とマージ規則を使い、テストで 1,500 以上の文字列のトークン ID を参照実装と照合しています。Claude、Gemini、GPT-6 はローカルで動かせる tokenizer が公開されていないため、表では o200k_base の数を目安として ≈ 付きで表示します。
このツールが数えるのは 1 つのプレーンテキストです。実際のリクエストにはロールや区切りの記号、システムプロンプト、ツール定義、画像やファイルが加わります。OpenAI は、トークン数カウント API の結果にこうした書式用トークンが含まれ、ローカルの tokenizer では見えないと説明しています。比べたい部分だけを貼り付けるか、各社の API にリクエスト全体を渡してください。
送信されません。カウントはブラウザ内の Web Worker で行います。tokenizer の語彙は本サイトの静的ファイルを必要に応じて読み込みます。前の処理を終了した後、次の計算で語彙を再読込する場合があります。リクエストに入力テキストは含まれず、開発者ツールの Network タブで確認できます。
同じ内容なら多くなる傾向があります。下の例では、英語 89 文字の指示が o200k_base で 18 トークン、同じ意味の日本語 34 文字が 28 トークンでした。cl100k_base(GPT-4)では日本語が 38 トークンになります。モデルを選ぶときは、実際の文章でトークン数を比べてください。
2026 年 10 月 1 日に OpenAI、Anthropic、Google、DeepSeek の公式料金ページで確認した米ドル単価で、日付は表の下に表示しています。円換算はしていません。料金は予告なく変わるため、予算を立てる前にリンク先を確認してください。