COVIDRead: 一个关于 COVID-19 的大规模问答数据集
计算与语言
2021-10-19 v1 人工智能
摘要
在当前疫情形势下,提取任何与 COVID-19 相关的信息都将对整个社会大有裨益。在本文中,我们提供了一个非常重要的资源:COVIDRead,这是一个类似于 Stanford Question Answering Dataset (SQuAD) 的数据集,包含超过 10 万个问答对。该数据集由“上下文-答案-问题”三元组构成。最初,上下文中的问题是以自动化方式构建的。随后,系统生成的问题由人工标注员进行人工核查。这一宝贵资源可用于多种目的,从普通大众针对这一罕见疾病的查询,到期刊编辑/副编辑对文章的管理。我们建立了多个基于端到端神经网络的基线模型,其最低 F1 值为 32.03%,最高 F1 值为 37.19%。据我们所知,我们是首个提供如此大规模 COVID-19 问答数据集的研究者。该数据集通过提供基准数据集和基线模型,为开展 COVID-19 相关研究开辟了新途径。
引用
@article{arxiv.2110.09321,
title = {COVIDRead: A Large-scale Question Answering Dataset on COVID-19},
author = {Tanik Saikh and Sovan Kumar Sahoo and Asif Ekbal and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2110.09321},
year = {2021}
}
备注
20 pages, 7 figures