casel

笔记工程5 分钟

你的语言可能比我的语言更费 token

分词是照着拉丁字母调的。这笔账,由其余所有人用延迟、上下文和金钱来付。

分词是「英文优先」这个假设不再停留在观念层面的地方。 分词器学的是怎么把文字切成小块,依据是它见得最多的东西。在偏拉丁的语料上学出来,它会给英文单词学到又长又划算的块,给其余所有语言学到又短又浪费的块。天城文、泰文、韩文以及其他许多文字,同一句话会被拆成多得多的 token。

三个后果,没有一个是抽象的

  • 花费:按 token 计费,所以同一个请求在某些语言里就是更贵。
  • 上下文:固定大小的上下文窗口里装得下的真实内容更少,长文档更早被截断。
  • 延迟:要生成的 token 更多,回应就更慢——偏偏是在本来就更慢的网络上。

别扭的地方在于,付这笔钱的人看不见它。账单上不会有一行写着「用你的文字思考更贵」。他们只会觉得这个工具差了那么一点,却说不上来为什么。

实际上能做什么

这里有一部分在我们手上,有一部分不在。 我们不训练前沿模型,所以改不了它们的分词器。我们能做的是别让问题变得更糟:提示词就用用户的语言写短,不要用英文脚手架把它撑大;在结构层面积极缓存,别每次都把同一套版式重新推导一遍;能在代码里做完、根本用不着模型的事,就在代码里做。

我们也会测。每种支持的语言,我们都记录每次构建的 token 数和首屏时间,然后看最好和最差那两种语言之间的差距,而不是看平均值。平均值恰恰是长尾变得不可见的方式。

如果你觉得自己语言的差距不对劲,把你当时打的那句话发给我们。这样一份反馈比任何跑分都值钱,因为它带着一个真实的人真正想写的句子。