超越字面 token 重叠:多语言 token 对齐性
计算与语言
2025-02-11 v1
摘要
以往的研究将 token 重叠或 token 分布相似性视为多语言性和跨语言知识迁移的预测指标。然而,这些字面的字面指标会对使用不同脚本的语言对赋予较大距离,而这些语言对却可能表现出良好的跨语言性。这限制了字面 token 重叠对跨脚本语言对之间知识迁移的解释力。本文提出了子词 token 对齐性(subword token alignability)作为理解多语言 tokenization 影响和质量的新方法。特别是,当脚本差异大且字面 token 重叠较低时,对齐性指标对预测多语言性效果更好。我们在 encoder 和 decoder 模型的上下文中分析该指标,考察数据规模是否为潜在干扰因素,并讨论如何将这些见解应用于未来工作中的多语言 tokenization。我们建议使用子词 token 对齐性指标来识别跨语言迁移的最佳语言对,以及指导未来更好地构建多语言 tokenizer。我们发布了代码和可重复性细节。
引用
@article{arxiv.2502.06468,
title = {Beyond Literal Token Overlap: Token Alignability for Multilinguality},
author = {Katharina Hämmerl and Tomasz Limisiewicz and Jindřich Libovický and Alexander Fraser},
journal= {arXiv preprint arXiv:2502.06468},
year = {2025}
}
备注
Accepted to NAACL 2025