颠覆单词:重新思考多语言分词器设计之艺术
计算与语言
2025-08-12 v1 人工智能
摘要
尽管模型架构和训练目标已得到广泛研究,但分词——尤其是多语言情境下的分词——仍是大型语言模型(LLM)开发中相对被忽视的方面。现有的分词器常常存在 token-to-word 比例高、上下文长度利用不高效、推理速度慢等问题。本文进行了一项系统性研究,将词汇规模、预分词规则和训练语料构成与 token-to-word 效率及模型质量联系起来。为奠定语言多样性背景下的分析依据,我们在印度语言脚本上进行大量实验,这些脚本因其高脚本多样性和字形复杂性呈现独特挑战。基于这些分析的洞见,我们提出了一种新型数据构成算法,用于平衡多语言数据以训练分词器。我们对预分词策略的观察显著改善了模型性能,我们的数据构成算法相对于常规数据随机化方法,使平均 token-to-word 比率降低约6%。本文所提出的分词器对 state-of-the-art 多语言印度语言模型的 token-to-word 比率平均提高超过40%。这一改进在模型性能和推理速度方面均带来可衡量的提升。这一发现将分词置于架构和训练目标之于高效、可扩展的多语言 LLM 构建的关键杠杆。
关键词
引用
@article{arxiv.2508.06533,
title = {The Art of Breaking Words: Rethinking Multilingual Tokenizer Design},
author = {Aamod Thakur and Ajay Nagpal and Atharva Savarkar and Kundeshwar Pundalik and Siddhesh Dosi and Piyush Sawarkar and Viraj Thakur and Rohit Saluja and Maunendra Sankar Desarkar and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2508.06533},
year = {2025}
}