Mintaka:面向端到端问答的复杂、自然且多语言数据集
计算与语言
2022-10-05 v1
摘要
我们介绍了 Mintaka,一个为端到端问答模型实验而设计的复杂、自然且多语言的数据集。Mintaka 由 20,000 个英文问答对组成,标注了 Wikidata 实体,并翻译为阿拉伯语、法语、德语、印地语、意大利语、日语、葡萄牙语和西班牙语,共计 180,000 个样本。Mintaka 包含 8 类复杂问题,包括最高级、交集和多跳问题,这些问题由众包工作者自然引出。我们在 Mintaka 上运行基线模型,其中最佳模型在英语上达到 38% 的 hits@1,在多语言上达到 31% 的 hits@1,表明现有模型仍有改进空间。我们在 https://github.com/amazon-research/mintaka 发布了 Mintaka。
引用
@article{arxiv.2210.01613,
title = {Mintaka: A Complex, Natural, and Multilingual Dataset for End-to-End Question Answering},
author = {Priyanka Sen and Alham Fikri Aji and Amir Saffari},
journal= {arXiv preprint arXiv:2210.01613},
year = {2022}
}
备注
Accepted at COLING 2022