PQuAD:一个波斯语问答数据集
计算与语言
2023-02-22 v1 信息检索
机器学习
摘要
我们提出了波斯语问答数据集 (PQuAD),一个基于波斯语维基百科文章的众包阅读理解数据集。它包含 80,000 个问题及其答案,其中 25% 的问题为对抗性不可回答。我们考察了该数据集的多种属性,以展示其作为机器阅读理解 (MRC) 基准的多样性和难度水平。通过发布该数据集,我们旨在简化波斯语阅读理解研究及波斯语问答系统的开发。我们在不同最先进的预训练上下文语言模型上的实验显示了 74.8% 的精确匹配 (EM) 和 87.6% 的 F1 分数,可作为进一步波斯语 QA 研究的基线结果。
引用
@article{arxiv.2202.06219,
title = {PQuAD: A Persian Question Answering Dataset},
author = {Kasra Darvishi and Newsha Shahbodagh and Zahra Abbasiantaeb and Saeedeh Momtazi},
journal= {arXiv preprint arXiv:2202.06219},
year = {2023}
}