中文

COUGH:一个用于 COVID-19 常见问题解答检索的挑战性数据集与模型

计算与语言 2021-09-13 v2 信息检索

摘要

我们提出一个大规模、具有挑战性的数据集 COUGH,用于 COVID-19 常见问题解答(FAQ)检索。与标准 FAQ 数据集类似,COUGH 由三部分组成:FAQ 库、查询库和相关性集合。FAQ 库包含从 55 个可信网站(如 CDC 和 WHO)抓取的约 16K 个 FAQ 条目。为进行评估,我们引入查询库和相关性集合,前者包含 1,236 个人工改写查询,后者包含每个查询约 32 个人工标注的 FAQ 条目。我们通过测试构建于 BM25 和 BERT 之上的不同 FAQ 检索模型来分析 COUGH,其中最佳模型在 P@5 下达到 48.8,表明 COUGH 带来了巨大挑战并鼓励未来研究进一步改进。我们的 COUGH 数据集可在 https://github.com/sunlab-osu/covid-faq 获取。

关键词

引用

@article{arxiv.2010.12800,
  title  = {COUGH: A Challenge Dataset and Models for COVID-19 FAQ Retrieval},
  author = {Xinliang Frederick Zhang and Heming Sun and Xiang Yue and Simon Lin and Huan Sun},
  journal= {arXiv preprint arXiv:2010.12800},
  year   = {2021}
}

备注

EMNLP'21 Main Conference