巴基亚亚洲语言理解任务的基准数据集的整合与发展
计算与语言
2025-11-17 v3
摘要
巴基亚语具有独特的语言特征,尤其是复杂的脚本(Devanagari脚本)、形态学以及各种方言,这构成了自然语言理解(NLU)任务的独特挑战。虽然巴基亚语言理解评估(Nep-gLUE)基准为评估模型提供了基础,但其范围有限,仅覆盖四个任务。这限制了其对自然语言处理(NLP)模型进行全面评估的实用性。为解决这一限制,我们引入了十二个新数据集,创建了一个新的基准——巴基亚/语言理解评估(NLUE)基准,用于评估模型在多样化自然语言理解(NLU)任务集上的性能。添加的任务包括单句分类、相似性和改写任务、自然语言推理(NLI)以及通用遮蔽评估任务(GMET)。通过大量实验,我们展示了现有顶级模型在这些任务中表现出对添加复杂度的挑战。我们还发现,最佳多语言模型在大多数任务中超越了最佳单语模型,凸显了针对巴基亚语开发更健壮解决方案的必要性。这一扩展基准为评估、比较和推进模型,为推动低资源语言的NLP研究贡献了重要贡献。
引用
@article{arxiv.2411.19244,
title = {Consolidating and Developing Benchmarking Datasets for the Nepali Natural Language Understanding Tasks},
author = {Jinu Nyachhyon and Mridul Sharma and Prajwal Thapa and Bal Krishna Bal},
journal= {arXiv preprint arXiv:2411.19244},
year = {2025}
}