中文

AmQA:阿姆哈拉语问答数据集

计算与语言 2023-11-17 v2 人工智能 信息检索

摘要

问答(QA)在给定上下文文档的情况下从自然语言文本中返回简洁答案或答案列表。大量资源被用于策划QA数据集以推进鲁棒模型的发展。英语等语言的QA数据集激增,但阿姆哈拉语并非如此。阿姆哈拉语是埃塞俄比亚的官方语言,是世界上第二大被使用的闪米特语。目前尚无已发布或公开可用的阿姆哈拉语QA数据集。因此,为促进阿姆哈拉语QA的研究,我们提出了首个阿姆哈拉语QA(AmQA)数据集。我们针对378篇维基百科文章众包了2628个问答对。此外,我们运行了一个基于XLMR Large的基线模型以激发开放域QA的研究兴趣。该最佳基线在检索器-阅读器QA和阅读理解设置中分别取得了69.58和71.74的F值。

关键词

引用

@article{arxiv.2303.03290,
  title  = {AmQA: Amharic Question Answering Dataset},
  author = {Tilahun Abedissa and Ricardo Usbeck and Yaregal Assabie},
  journal= {arXiv preprint arXiv:2303.03290},
  year   = {2023}
}