casel

NotesTechnique5 min

Votre langue coûte plus de tokens que la mienne

La tokenisation a été ajustée à l’écriture latine. Tous les autres le paient en latence, en contexte et en argent.

C’est à la tokenisation que l’hypothèse anglaise cesse d’être philosophique. Un tokenizer apprend à découper le texte selon ce qu’il a le plus vu. Entraîné sur un corpus penchant vers le latin, il apprend des morceaux longs et efficaces pour les mots anglais, et courts et inefficaces pour tout le reste. Le devanagari, le thaï, le coréen et bien d’autres se fragmentent en beaucoup plus de tokens pour la même phrase.

Trois conséquences, aucune abstraite

  • Le coût : la facturation se fait au token, la même requête coûte donc plus cher dans certaines langues.
  • Le contexte : une fenêtre de taille fixe contient moins de votre contenu réel, les longs documents sont tronqués plus tôt.
  • La latence : plus de tokens à générer, donc réponse plus lente — sur les connexions déjà les plus lentes.

Le plus gênant, c’est que la personne qui paie ne le voit pas. Aucune ligne de facture ne dit que penser dans votre écriture coûte plus cher. On ressent seulement un outil un peu moins bon, sans pouvoir dire pourquoi.

Ce qu’on peut réellement faire

Une partie dépend de nous, une autre non. Nous n’entraînons pas les modèles de pointe, nous ne pouvons donc pas réécrire leurs tokenizers. Ce que nous pouvons faire, c’est ne pas aggraver le problème : garder les prompts courts dans la langue de l’utilisateur au lieu de les gonfler d’échafaudages anglais, mettre en cache au niveau de la structure pour ne pas redériver la même mise en page à chaque fois, et faire dans le code le travail qui n’a besoin d’aucun modèle.

Nous le mesurons aussi. Pour chaque langue prise en charge, nous suivons les tokens par création et le temps du premier affichage, et nous regardons l’écart entre la meilleure et la pire langue plutôt que la moyenne. Une moyenne, c’est exactement la façon dont une longue traîne disparaît.

Si l’écart vous paraît anormal pour votre langue, dites-nous ce que vous aviez tapé. Ce signalement vaut mieux qu’un benchmark, parce qu’il vient avec la phrase qu’une vraie personne voulait vraiment écrire.