中文

分词至关重要:提高印地语言零样本命名实体识别

计算与语言 2025-04-25 v1 人工智能

摘要

分词是自然语言处理(NLP)的关键组件,尤其是对于资源匮乏的语言,子词分段会影响词汇结构和下游任务准确性。虽然字节对编码(BPE)是多语言语言模型中的标准分词方法,但其针对资源匮乏印地语言命名实体识别(NER)的适用性尚未得到充分探索,due to其在处理形态复杂度方面的局限性。在本工作中,我们系统比较了BPE、SentencePiece和字符级分词策略,针对阿萨姆语、孟加拉语、马拉拉语和奥利亚语等资源匮乏的印地语言,以及萨尔提语、马纳姆比尔语和信底语等极度资源匮乏的印地语言进行NER任务。我们评估了分词的内在语言属性、分词效率、词汇外率(OOV)以及形态保持情况,以及外在下游性能,包括微调和零样本跨语言迁移。我们的实验表明,SentencePiece在资源匮乏印地语言的NER任务中始终优于BPE,尤其是在零样本跨语言设置下,因其更好地保留实体一致性。虽然BPE提供最紧凑的分词形式,但其无法实现泛化,因为在测试未见语言时会产生误分类甚至无法识别实体标签。相比之下,SentencePiece构成更好的语言结构保存模型,特别适用于资源极度匮乏且形态复杂的印地语言,如萨尔提语和马纳姆比尔语,能够实现更优的实体识别;同时在跨脚本(如信底语使用阿拉伯文字)方面也表现出更好的高泛化性。结果表明,SentencePiece是印地语多语言和资源匮乏NLP应用中NER更有效的分词策略。

关键词

引用

@article{arxiv.2504.16977,
  title  = {Tokenization Matters: Improving Zero-Shot NER for Indic Languages},
  author = {Priyaranjan Pattnayak and Hitesh Laxmichand Patel and Amit Agarwal},
  journal= {arXiv preprint arXiv:2504.16977},
  year   = {2025}
}