中文

阿拉伯语问答综合数据集 ArabicaQA

计算与语言 2024-03-27 v1 信息检索

摘要

本文提出 ArabicaQA,即首个面向阿拉伯语自然语言处理领域的大规模数据集,用于机器阅读理解和开放域问答。该数据集由 89,095 个可回答问题和 3,701 个不可回答问题组成(后者由众包工作者创建,旨在看似可回答),并附带开放域问题标记。这一全面的数据集是阿拉伯语 NLP 资源的重要进步。我们还介绍了 AraDPR,即首个在阿拉伯语维基百科语料库上训练的密集 passage 检索模型,专为解决阿拉伯语文本检索的独特挑战而设计。此外,我们的研究还包括对大型语言模型(LLM)在阿拉伯语问答任务中的广泛基准测试,关键评估其在阿拉伯语语境下的性能。总之,ArabicaQA、AraDPR 以及在阿拉伯语问答领域对大型语言模型的基准测试,为阿拉伯语 NLP 领域带来了重要进展。数据集和代码公开 accessible,地址为 https://github.com/DataScienceUIBK/ArabicaQA。

关键词

引用

@article{arxiv.2403.17848,
  title  = {ArabicaQA: A Comprehensive Dataset for Arabic Question Answering},
  author = {Abdelrahman Abdallah and Mahmoud Kasem and Mahmoud Abdalla and Mohamed Mahmoud and Mohamed Elkasaby and Yasser Elbendary and Adam Jatowt},
  journal= {arXiv preprint arXiv:2403.17848},
  year   = {2024}
}

备注

Accepted at SIGIR 2024