中文

Mintaka:面向端到端问答的复杂、自然且多语言数据集

计算与语言 2022-10-05 v1

摘要

我们介绍了 Mintaka,一个为端到端问答模型实验而设计的复杂、自然且多语言的数据集。Mintaka 由 20,000 个英文问答对组成,标注了 Wikidata 实体,并翻译为阿拉伯语、法语、德语、印地语、意大利语、日语、葡萄牙语和西班牙语,共计 180,000 个样本。Mintaka 包含 8 类复杂问题,包括最高级、交集和多跳问题,这些问题由众包工作者自然引出。我们在 Mintaka 上运行基线模型,其中最佳模型在英语上达到 38% 的 hits@1,在多语言上达到 31% 的 hits@1,表明现有模型仍有改进空间。我们在 https://github.com/amazon-research/mintaka 发布了 Mintaka。

关键词

引用

@article{arxiv.2210.01613,
  title  = {Mintaka: A Complex, Natural, and Multilingual Dataset for End-to-End Question Answering},
  author = {Priyanka Sen and Alham Fikri Aji and Amir Saffari},
  journal= {arXiv preprint arXiv:2210.01613},
  year   = {2022}
}

备注

Accepted at COLING 2022