Tokenowy Mundial AI
Ten sam neutralny zestaw faktów zapisany naturalnie w każdym języku, bez dosłownego tłumaczenia zdanie po zdaniu. Im mniej tokenów, tym mniej miejsca w kontekście i niższy koszt inputu. Polski: +29% względem angielskiego. 🇵🇱💸
Ranking
Pełna tabela
| # | Język | Tokeny | vs EN | Indeks EN=100 |
|---|
Mapa rozjazdu tokenizerów
Jak to czytać
Każda wersja przekazuje ten sam neutralny zestaw faktów o kulkach, liczbach, porównaniu i równym podziale.
To nie tłumaczenie zdanie po zdaniu. Każdy wariant jest zapisany tak, jak naturalnie można przekazać te informacje w danym języku; cyfry pozostają identyczne.
Główne porównanie to GPT-5, Claude Opus 5.5 i DeepSeek V4.1; dodatkowo można podejrzeć r50k_base, cl100k_base i o200k_harmony. Ranking, podium, tabela i narzut względem EN zmieniają się razem.
GPT-5 i dodatkowe kodowania GPT przelicza lokalnie gpt-tokenizer; DeepSeek V4.1 liczy oficjalny tokenizer z deepseek-ai/deepseek-recipe, przypięty do rewizji i SHA-256, przez recount-deepseek-tokens.py. o200k_harmony współdzieli z o200k_base BPE zwykłego tekstu, więc w tym korpusie remisuje 1:1; różni się tokenami specjalnymi. Pomiar Claude Opus 5.5 w claude-opus-5-5-token-counts.json pochodzi z natywnego licznika wejścia przez OpenRouter /v1/messages; stały framing 8 tokenów jest odejmowany. Opus 5 daje identyczne liczby we wszystkich 27 językach (różni się tylko framingiem: 6), więc tokenizer się nie zmienił; jego pomiar został w claude-token-counts.json.