解释与缓解跨语言标记化不平等
计算与语言
2025-10-28 v1
摘要
对不同语言中编码平行文本所需的标记数已知会有所不同。这些差异称为标记溢价。高标记溢价会导致训练期间的吞吐量降低,并增加推理成本。在本文中,我们表明,即便控制了数据规模、词汇规模和数据内容,单语言标记化器在不同语言之间 exhibits 广泛的标记溢价。为理解导致这些标记溢价的跨语言差异,我们训练了约 7,000 个可比单语言标记化器,覆盖 97 种语言,操控标记化算法、词汇规模和数据规模。我们测量标记溢价,并测试数据相似性(标记化器训练与评估之间)、词汇规模和预标记化之间的关系。我们还研究了语言特定特征(如书写系统和词长)的作用。我们发现,训练和测试数据之间的相似性不影响标记溢价,但词汇规模和预标记化会影响。虽然仅增加词汇规模并不会导致标记溢价效应显著降低,但我们可以为每种语言确定一个“最佳”词汇规模,以实现显著降低标记溢价。我们还训练了超词标记化器,允许在空白字符上进行合并,我们发现它们既能降低跨语言标记溢价效应,又能整体提高压缩效果。因此,针对词汇规模或预标记化器进行干预可显著降低跨语言标记溢价效应。
引用
@article{arxiv.2510.21909,
title = {Explaining and Mitigating Crosslingual Tokenizer Inequities},
author = {Catherine Arnett and Tyler A. Chang and Stella Biderman and Benjamin K. Bergen},
journal= {arXiv preprint arXiv:2510.21909},
year = {2025}
}
备注
Accepted to NeurIPS 2025