中文

缅甸 XNLI:构建数据集并探索以缅甸语为例的低资源自然语言推理方法

计算与语言 2025-04-15 v1 人工智能

摘要

尽管近期在 NLP 领域取得了显著进展,但将大语言模型 (LLM) 应用于低资源语言仍是一个重大挑战。这在诸如交叉语言自然语言推理 (XNLI) 等基准测试中表现突出,该任务展示了 NLP 系统在 15 种语言范围内的交叉语言能力。本文将 XNLI 任务扩展至第 16 种低资源语言——缅甸语,作为更广泛低资源语言的代理挑战,并作出三项核心贡献。第一项是使用社区众包方法构建名为缅甸 XNLI (myXNLI) 的数据集,作为现有 XNLI 语料库的扩展。这涉及社区构建后跟随专家验证的两阶段过程;通过分析,我们量化了在社区构建低资源语言语境中专家验证阶段的价值。我们将 myXNLI 数据集向社区公开,以供未来研究使用。第二项是对最近的多语言语言模型在 myXNLI 基准上的进行评估,并探索数据增强方法以提高模型性能。我们的数据增强方法可使缅甸语模型准确率提升最高 2 个百分点,同时也能提升其他语言的性能。第三项是我们探讨了这些数据增强方法在 XNLI 数据集中的其他低资源语言上的泛化能力。

关键词

引用

@article{arxiv.2504.09645,
  title  = {Myanmar XNLI: Building a Dataset and Exploring Low-resource Approaches to Natural Language Inference with Myanmar},
  author = {Aung Kyaw Htet and Mark Dras},
  journal= {arXiv preprint arXiv:2504.09645},
  year   = {2025}
}