印度语言视角下的多语言分词:挑战与洞见
计算与语言
2025-06-25 v2
摘要
分词在多语言NLP中起着关键作用。然而,现有分词器常偏向高资源语言,限制了其对印度次大陆此类语言——尤其是语言多样且形态丰富的语言——的有效性。本文对17种印度语言的分词策略进行全面内在评估。我们量化了自下而上与自上而下分词算法(BPE和Unigram LM)之间的权衡、词汇表大小的影响,并比较了多语言词汇构建策略,如联合训练和聚类训练。我们还指出,极低资源语言可以从在相关高资源语言上训练的分词器中受益。我们的研究为构建更公平、更高效、更具语言学信息的多语言分词器提供了实用见解。
关键词
引用
@article{arxiv.2506.17789,
title = {Multilingual Tokenization through the Lens of Indian Languages: Challenges and Insights},
author = {N J Karthika and Maharaj Brahma and Rohit Saluja and Ganesh Ramakrishnan and Maunendra Sankar Desarkar},
journal= {arXiv preprint arXiv:2506.17789},
year = {2025}
}