中文

BanLemma:一种基于词形构成规则与词典的孟加拉语词形还原器

计算与语言 2023-11-07 v1

摘要

词形还原在自然语言处理(NLP)和语言学中具有重要意义,它能有效降低数据密度并有助于理解上下文含义。然而,由于孟加拉语高度屈折且形态丰富,孟加拉语文本的词形还原是一项复杂挑战。在本研究中,我们提出用于词形还原的语言学规则,并利用词典与这些规则设计一个专门针对孟加拉语的词形还原器。我们的系统旨在根据给定句子中词的词性类别对其进行词形还原。与以往基于规则的方法不同,我们依据形态句法值分析后缀标记的出现情况,然后使用后缀标记序列而非完整后缀。为制定规则,我们分析了来自不同领域、来源和时期的孟加拉语大型语料库,以观察屈折词的词形构成。该词形还原器在经训练语言学家人工标注的测试数据集上达到96.36%的准确率,并在三个已发布的孟加拉语词形还原数据集上展现出有竞争力的性能。我们将代码与数据集公开于https://github.com/eblict-gigatech/BanLemma,以推动孟加拉语NLP的进一步发展。

关键词

引用

@article{arxiv.2311.03078,
  title  = {BanLemma: A Word Formation Dependent Rule and Dictionary Based Bangla Lemmatizer},
  author = {Sadia Afrin and Md. Shahad Mahmud Chowdhury and Md. Ekramul Islam and Faisal Ahamed Khan and Labib Imam Chowdhury and MD. Motahar Mahtab and Nazifa Nuha Chowdhury and Massud Forkan and Neelima Kundu and Hakim Arif and Mohammad Mamun Or Rashid and Mohammad Ruhul Amin and Nabeel Mohammed},
  journal= {arXiv preprint arXiv:2311.03078},
  year   = {2023}
}