中文

SLEDGE-Z:一种用于 COVID-19 文献检索的零样本基线方法

计算与语言 2020-10-14 v1 信息检索

摘要

随着全球对严重急性呼吸综合征冠状病毒 2(SARS-CoV-2)的关注,关于该病毒的科学文献正在迅速增长。临床医生、研究人员和决策者需要能够有效检索这些文章。在这项工作中,我们提出了一种适应于 COVID 相关科学文献的零样本排序算法。我们的方法将另一集合中的训练数据筛选至医学相关查询,使用在科学文本(SciBERT)上预训练的神经网络重排序模型,并对目标文档集合进行过滤。该方法在 TREC COVID 第一轮排行榜的零样本方法中排名居首,并在第一轮和第二轮评判上评估时取得了 P@5 为 0.80 和 nDCG@10 为 0.68 的成绩。尽管不依赖 TREC-COVID 数据,我们的方法仍优于那些依赖该数据的方法。作为最早对 COVID-19 检索进行彻底评估的检索方法之一,我们希望这能作为一个强基线并助力于这场全球危机。

关键词

引用

@article{arxiv.2010.05987,
  title  = {SLEDGE-Z: A Zero-Shot Baseline for COVID-19 Literature Search},
  author = {Sean MacAvaney and Arman Cohan and Nazli Goharian},
  journal= {arXiv preprint arXiv:2010.05987},
  year   = {2020}
}

备注

EMNLP 2020. This article draws heavily from arXiv:2005.02365