トークン数カウンター

OpenAI の o200k_base・cl100k_base と DeepSeek 公式の tokenizer でトークン数をブラウザ内で正確にカウント。分割結果の表示と、GPT・Claude・Gemini・DeepSeek の料金試算に対応。

  • ブラウザ内で処理
  • データはブラウザ外に出ません
  • 無料 · 登録不要
プレーンテキスト、プロンプト、コードを貼り付けると入力に合わせて更新します。編集や消去で前の計算を終了します。ロール、ツール定義、画像、PDF は数に含みません。
20 MB までの UTF-8 テキストファイルを開き、入力を置き換えます。入力の編集、「サンプル」「クリア」は未完了のファイル読み込みを無効にします。
想定する出力トークン数を入れると、リクエストごとの出力料金と合計を試算します。回答は生成しません。標準料金にバッチ・キャッシュ割引は含みません。
tokenizer を選ぶと先頭 2,000 トークンを表示し、未読込なら語彙も読み込みます。トークン ID を有効にすると枠に数値 ID を付けます。合計にはすべてのトークンを数えます。

テキストを入力または貼り付けると、入力に合わせて数が更新されます。

tokenizer の語彙は本サイトから必要に応じて読み込みます。入力テキストはブラウザー内に留まります。

— トークン (o200k_base) o200k_base は自動で数えます。DeepSeek V4 や cl100k_base カードの「カウント」で語彙(0.5 MB、0.4 MB)を読み込み、失敗時は「再試行」が出ます。各カウントは公開された tokenizer の規則に従います。 0 文字 0 UTF-8 バイト 0 語 0 行

o200k_base

正確

— トークン

GPT-5.5、GPT-5.4、GPT-4.1、GPT-4o、o3、o4-mini

DeepSeek V4

正確

— トークン

deepseek-flash、deepseek-v4-pro

cl100k_base

正確

— トークン

GPT-4、GPT-3.5 Turbo、text-embedding-3

Claude・Gemini・GPT-6

ローカル tokenizer なし

ローカルで動かせる tokenizer は公開されていません。正確な数は各社の無料のトークン数カウント API で確認してください。下の表では o200k_base の数を目安として使います。

モデル別の料金

モデル 入力トークン コンテキスト使用率 入力 出力 合計

≈ は o200k_base の数を目安として使った値です。これらのモデルは独自の tokenizer を使うため、実際の数は異なります。Anthropic によると、Claude 4.7 以降は同じテキストで以前の Claude より約 30% 多くトークンを数えます。

トークン分割

枠 1 つが 1 トークンです。⟨⟩ 内は 1 文字の一部だけのバイトで、次のトークンが残りを持ちます。

詳しいガイドを読む AI のトークンとは:tokenizer は日本語をどう数えるか
例・詳しい説明・よくある質問 実際の出力つきの例、ほかのツールとの違い、よくある質問。

日本語のトークン数を比べる

議事録の要約を頼む同じ意味の指示を、英語と日本語で数えました。

テキスト文字数o200k_basecl100k_baseDeepSeek V4
Summarize the meeting notes below in three lines and list the decisions and action items.89181817
以下の議事録を3行で要約し、決定事項と宿題を箇条書きにしてください。34283825

英語は 3 つの tokenizer でほぼ同じですが、日本語は cl100k_base が o200k_base より 36% 多くなります。GPT-4 から GPT-4o 以降に移ると、同じ日本語のプロンプトでも入力トークンが減るということです。

「サンプル」ボタンで入る 275 文字のレビュー依頼文では、次の結果になります。

  • DeepSeek V4:180 トークン(1 トークンあたり 1.53 文字)
  • o200k_base:189 トークン(1.46 文字)
  • cl100k_base:242 トークン(1.14 文字)

ただし短い文では順位が入れ替わります。「こんにちは、世界」は o200k_base で 3、cl100k_base で 5、DeepSeek V4 で 7 トークンです。DeepSeek の tokenizer は漢字・ひらがな・カタカナが続く部分を先に 1 つのまとまりとして切り出してから分割するため、よく使われるあいさつでも複数のトークンに分かれます。少数の例から「どのモデルが安いか」を決めず、実際の文章で数えるのが確実です。

正確にカウントできるモデル

カード対象モデル根拠
o200k_baseGPT-5.x、GPT-4.1、GPT-4o、o1、o3、o4-miniOpenAI の tiktoken のモデル対応表
cl100k_baseGPT-4、GPT-3.5 Turbo、text-embedding-3同じ対応表と Embeddings ガイド
DeepSeek V4deepseek-flash、deepseek-v4-proDeepSeek のオフライン計算パッケージに入っている tokenizer.json
≈ 目安Claude、Gemini、GPT-6ローカル用 tokenizer は非公開。o200k_base の数で代用

Claude は Anthropic のトークン数カウント API(無料)で数えられますが、ドキュメント自身が結果を推定値としています。また Claude 4.7 以降は、同じテキストで以前の Claude より約 30% 多くトークンを数えると明記しています。Gemini は Google の説明で「1 トークンは約 4 文字」とされるだけなので、正確な数は countTokens で確認してください。

料金の列について

単価は 2026 年 10 月 1 日に確認した標準料金(バッチ割引・キャッシュなし)で、すべて米ドルです。長い入力で単価が上がるモデルは自動で切り替えます。gpt-5.5 と GPT-6 は入力 272,000 トークン超、gemini-3.1-pro-preview は 200,000 トークン超です。DeepSeek はオフピーク(日本時間で平日 10 時〜13 時と 15 時〜19 時以外)が半額で、両方の金額を表示します。

ほかのツールとの違い

2026 年 10 月 1 日、レビュー依頼文の 1 文目(80 文字、o200k_base 44、cl100k_base 56、DeepSeek V4 45 トークン)で確認しました。

  • MiniWebtool の AI トークンカウンター(日本語版):93 トークンと表示し、可視化では仮名 1 文字ずつに区切られていました。o200k_base(44)の 2 倍以上です。
  • benchlm.ai:中国語の 56 文字の文で「~14 tokens」と表示し、Claude・Gemini・DeepSeek をすべて 14 としていました。実際は o200k_base で 35、DeepSeek V4 で 26 です。
  • tokencost.app:同じ中国語文で DeepSeek V4.1 Flash を「42~」と表示しました。実際は 26 です。

このページの旧版は js-tiktoken を使っていました。js-tiktoken は空白のない長い文字列でマージ処理が極端に遅く、漢字 2 万字の連続で 3 分以上かかりました。新版は優先度付きキューでマージし、同じ入力を数ミリ秒で処理します。また BOM(U+FEFF)を含むテキストでも tiktoken と同じ位置で区切ります。

制限事項

文字の統計、事前分割、トークン計算は Web Worker で行います。入力を編集または消去すると前の計算を終了します。ページには統計、全体の数、先頭 2,000 トークンの表示データだけを返します。大きなテキストの入力欄への描画には時間がかかる場合があります。当サイトのテスト(Apple M1 Max、Chromium 152、2026-10-03)では、中国語と英語が混ざった 100 万文字を入力欄に表示するのに 1~2 秒、その後 o200k_base でのカウントに約 1.1~1.9 秒かかりました。

  • 数えるのはプレーンテキストだけです。メッセージの書式、システムプロンプト、ツール定義、画像、PDF の分は各社の API でしか分かりません。
  • <|endoftext|> などの OpenAI の特殊トークンは普通の文字列として数えます(7 トークン)。tiktoken の encode_ordinary と同じです。DeepSeek の <|User|> などは公式 tokenizer.json に従い 1 トークンです。
  • Claude、Gemini、GPT-6 の行は目安です。
  • DeepSeek のパッケージのサンプルは transformers で読み込みます。transformers 5.18.0 ではこのパッケージの中国語テキストが空のリストになりました。4.57.6 と tokenizers ライブラリは本ページと同じ結果です。
  • 料金は 2026 年 10 月 1 日時点で、税、地域ごとの上乗せ、個別契約の割引は含みません。

関連ツール:文字数や単語数は単語・文字数カウンター、プロンプトに API キーが残っていないかはAPIキーマスキング、バッチ用のファイルは JSONL コンバーターで扱えます。

FAQ

どの数字が正確ですか?

o200k_base、cl100k_base、DeepSeek V4 の 3 枚のカードです。OpenAI の tiktoken、DeepSeek 公式の tokenizer.json と同じ語彙とマージ規則を使い、テストで 1,500 以上の文字列のトークン ID を参照実装と照合しています。Claude、Gemini、GPT-6 はローカルで動かせる tokenizer が公開されていないため、表では o200k_base の数を目安として ≈ 付きで表示します。

API の usage と数が合わないのはなぜですか?

このツールが数えるのは 1 つのプレーンテキストです。実際のリクエストにはロールや区切りの記号、システムプロンプト、ツール定義、画像やファイルが加わります。OpenAI は、トークン数カウント API の結果にこうした書式用トークンが含まれ、ローカルの tokenizer では見えないと説明しています。比べたい部分だけを貼り付けるか、各社の API にリクエスト全体を渡してください。

入力したテキストは送信されますか?

送信されません。カウントはブラウザ内の Web Worker で行います。tokenizer の語彙は本サイトの静的ファイルを必要に応じて読み込みます。前の処理を終了した後、次の計算で語彙を再読込する場合があります。リクエストに入力テキストは含まれず、開発者ツールの Network タブで確認できます。

日本語は英語よりトークンが多くなりますか?

同じ内容なら多くなる傾向があります。下の例では、英語 89 文字の指示が o200k_base で 18 トークン、同じ意味の日本語 34 文字が 28 トークンでした。cl100k_base(GPT-4)では日本語が 38 トークンになります。モデルを選ぶときは、実際の文章でトークン数を比べてください。

料金はいつの情報ですか?

2026 年 10 月 1 日に OpenAI、Anthropic、Google、DeepSeek の公式料金ページで確認した米ドル単価で、日付は表の下に表示しています。円換算はしていません。料金は予告なく変わるため、予算を立てる前にリンク先を確認してください。