中文

印度语言视角下的多语言分词:挑战与洞见

计算与语言 2025-06-25 v2

摘要

分词在多语言NLP中起着关键作用。然而,现有分词器常偏向高资源语言,限制了其对印度次大陆此类语言——尤其是语言多样且形态丰富的语言——的有效性。本文对17种印度语言的分词策略进行全面内在评估。我们量化了自下而上与自上而下分词算法(BPE和Unigram LM)之间的权衡、词汇表大小的影响,并比较了多语言词汇构建策略,如联合训练和聚类训练。我们还指出,极低资源语言可以从在相关高资源语言上训练的分词器中受益。我们的研究为构建更公平、更高效、更具语言学信息的多语言分词器提供了实用见解。

关键词

引用

@article{arxiv.2506.17789,
  title  = {Multilingual Tokenization through the Lens of Indian Languages: Challenges and Insights},
  author = {N J Karthika and Maharaj Brahma and Rohit Saluja and Ganesh Ramakrishnan and Maunendra Sankar Desarkar},
  journal= {arXiv preprint arXiv:2506.17789},
  year   = {2025}
}