中文

从多项选择到抽取式问答:以英语与阿拉伯语为例的案例研究

计算与语言 2025-01-27 v2 人工智能

摘要

自然语言处理(NLP)的快速发展惠及了英语等主要语言,但由于资源有限,许多其他语言仍存在显著差距。这在数据标注的语境中尤为明显,该任务的重要性不容低估,却既耗时又昂贵。因此,任何面向资源匮乏语言的数据集都极其宝贵,尤其是针对特定任务的数据集。在此,我们探索了将现有大规模多语言数据集重新用于新 NLP 任务的可行性:我们将 BELEBELE 数据集(Bandarkar et al., 2023)的一个子集从原本用于多项选择问答(MCQA)改造为支持机器阅读理解风格的、更具实用价值的抽取式问答(EQA)任务。我们提供了英语与现代标准阿拉伯语(MSA)的标注指南及平行 EQA 数据集。我们还展示了包括英语、MSA 以及五种阿拉伯语方言在内的多个单语与跨语言 QA 对的问答评估结果。我们旨在帮助他人将我们的方法适配到 BELEBELE 剩余的 120 种语言变体中,其中许多被认为是资源匮乏的。我们还提供了详尽的分析并分享了见解,以加深对 NLP 任务重构中挑战与机遇的理解。

关键词

引用

@article{arxiv.2404.17342,
  title  = {From Multiple-Choice to Extractive QA: A Case Study for English and Arabic},
  author = {Teresa Lynn and Malik H. Altakrori and Samar Mohamed Magdy and Rocktim Jyoti Das and Chenyang Lyu and Mohamed Nasr and Younes Samih and Kirill Chirkunov and Alham Fikri Aji and Preslav Nakov and Shantanu Godbole and Salim Roukos and Radu Florian and Nizar Habash},
  journal= {arXiv preprint arXiv:2404.17342},
  year   = {2025}
}

备注

Paper 8 pages, Appendix 12 pages. Published at COLING2025