中文

SentiMaithili:面向低资源马齐利语言的情感与理由生成基准数据集

计算与语言 2025-10-28 v1 计算机视觉与模式识别

摘要

为低资源语言开发基准数据集面临诸多挑战,主要源于本地语言学专家有限且标注工作耗时耗费。鉴于这些挑战,马齐利语言在自然语言处理研究中仍属薄弱环节。马齐利是一种印度东北部(Purvanchal 区域)口语超过千万人的印度-阿拉伯语,因其丰富的语言结构和文化意义而受到重视。尽管情感分析在高资源语言上取得了显著进展,但面向低资源语言(如马齐利)的资源仍稀缺,往往仅限于粗粒度标注且缺乏可解释性机制。为此,我们引入一个新型数据集,包含 3,221 句马齐利语句子,标注情感极性并附带自然语言理由。该数据集由语言学专家仔细策划并验证,确保标签可靠性和语境忠实性。值得注意的是,理由均以马齐利语撰写,从而促进了文化内在的解释性,增强了情感模型的可解释性。此外,通过使用经典机器学习方法和最新 transformer 架构进行大量实验,证明了该数据集在可解释情感分析中的有效性。最终本工作建立了马齐利语言中首个可解释情感计算基准,为更广泛的多语言 NLP 和可解释人工智能发展贡献了宝贵资源。

关键词

引用

@article{arxiv.2510.22160,
  title  = {SentiMaithili: A Benchmark Dataset for Sentiment and Reason Generation for the Low-Resource Maithili Language},
  author = {Rahul Ranjan and Mahendra Kumar Gurve and Anuj and Nitin and Yamuna Prasad},
  journal= {arXiv preprint arXiv:2510.22160},
  year   = {2025}
}