COUGH:一个用于 COVID-19 常见问题解答检索的挑战性数据集与模型
计算与语言
2021-09-13 v2 信息检索
摘要
我们提出一个大规模、具有挑战性的数据集 COUGH,用于 COVID-19 常见问题解答(FAQ)检索。与标准 FAQ 数据集类似,COUGH 由三部分组成:FAQ 库、查询库和相关性集合。FAQ 库包含从 55 个可信网站(如 CDC 和 WHO)抓取的约 16K 个 FAQ 条目。为进行评估,我们引入查询库和相关性集合,前者包含 1,236 个人工改写查询,后者包含每个查询约 32 个人工标注的 FAQ 条目。我们通过测试构建于 BM25 和 BERT 之上的不同 FAQ 检索模型来分析 COUGH,其中最佳模型在 P@5 下达到 48.8,表明 COUGH 带来了巨大挑战并鼓励未来研究进一步改进。我们的 COUGH 数据集可在 https://github.com/sunlab-osu/covid-faq 获取。
引用
@article{arxiv.2010.12800,
title = {COUGH: A Challenge Dataset and Models for COVID-19 FAQ Retrieval},
author = {Xinliang Frederick Zhang and Heming Sun and Xiang Yue and Simon Lin and Huan Sun},
journal= {arXiv preprint arXiv:2010.12800},
year = {2021}
}
备注
EMNLP'21 Main Conference