中文

脚本税:衡量多语言语言模型中分词驱动的效率与延迟差异

计算与语言 2026-02-13 v1 人工智能

摘要

预训练的多语言语言模型常被假设为无脚本无关,但其分词器可能对某些书写系统施加系统性成本。我们通过比较具有相同语言内容的两种正字变体来量化此类 script tax。在 mBERT 和 XLM-R 上,较高碎片化的正字体显示约 3.4 倍的 fertility(6.73-6.85 与 2.10-2.35 个 token/词),导致在相同硬件上的推理速度减缓约 16.5 倍(0.23 与 3.8 个句子/秒)。采用字符比特数(BPC)以规避子词碎片化的“NLL 矛盾”,我们发现信息成本显著增加:mBERT 增加 19.7%(8.06→9.65),XLM-R 增加 47.1%(12.19→17.94)。轮询转换检查(CER_rt=0.31)表明,这些差距反映的是正字体条件化处理,而非映射噪声。我们的结果凸显了分词作为多语言 NLP 公平性关键来源之一,并激励脚本感知分词与预训练。

关键词

引用

@article{arxiv.2602.11174,
  title  = {The Script Tax: Measuring Tokenization-Driven Efficiency and Latency Disparities in Multilingual Language Models},
  author = {Aradhya Dixit and Shreem Dixit},
  journal= {arXiv preprint arXiv:2602.11174},
  year   = {2026}
}