复用 TREC-COVID 标注以回答 CORD-19 的关键问题
计算与语言
2020-08-31 v1 信息检索
机器学习
摘要
2019 年新型冠状病毒病(COVID-19)于 2019 年底在中国武汉出现,迄今已在全球感染超过 1400 万人,导致超过 75 万人死亡。2020 年 3 月 10 日,世界卫生组织(WHO)宣布此次疫情为全球大流行。许多学者和研究人员(不限于医学领域)开始发表描述新发现的论文。然而,随着大量文献的涌入,这些个人很难筛选海量数据并理解其中的发现。白宫与由艾伦人工智能研究所牵头的一组工业研究实验室,汇总了超过 20 万篇与多种冠状病毒相关的期刊文章,并委托学界回答与该语料库相关的关键问题,将该数据集发布为 CORD-19。信息检索(IR)学界将 CORD-19 中的期刊文章改造为更贴近经典 TREC 风格竞赛的形式,称为 TREC-COVID,由人类标注员在每一轮竞赛结束时提供相关性判断。鉴于这些相关努力,我们着手将 TREC-COVID 任务的相关性标注改造用于识别 CORD-19 中与 CORD-19 所提出关键问题相关的期刊文章。在此改造数据集上训练的 BioBERT 模型为 CORD-19 任务标注的相关性,与多数人类标注在 Cohen's kappa 意义上总体一致度为 0.4430。我们给出了构建新数据集所用的方法,并描述了整个过程中的决策流程。
引用
@article{arxiv.2008.12353,
title = {Repurposing TREC-COVID Annotations to Answer the Key Questions of CORD-19},
author = {Connor T. Heaton and Prasenjit Mitra},
journal= {arXiv preprint arXiv:2008.12353},
year = {2020}
}