中文

CO-Search:基于语义检索、问答与抽象式摘要的 COVID-19 信息检索

信息检索 2020-06-18 v1 人工智能 计算与语言

摘要

COVID-19 全球大流行引发了国际范围内理解、追踪和缓解该疾病的努力,在各科学学科中产生了大量与 COVID-19 和 SARS-CoV-2 相关的出版物。截至 2020 年 5 月,通过 COVID-19 开放研究数据集挑战已收集到 128,000 篇冠状病毒相关出版物。在此我们提出 CO-Search,一种检索器-排序器语义搜索引擎,旨在处理 COVID-19 文献上的复杂查询,有望在危机时期帮助负担过重的卫生工作者寻找科学答案。该检索器由一个 Siamese-BERT 编码器构建,该编码器与 TF-IDF 向量化器线性组合,并与 BM25 向量化器进行倒数排名融合。排序器由一个多跳问答模块组成,该模块与多段落抽象式摘要器共同调整检索器分数。为应对特定领域且相对有限的数据集,我们生成文档段落与引用的二部图,创建了 130 万(引用标题,段落)元组用于训练编码器。我们在 TREC-COVID 信息检索挑战的数据上评估了我们的系统。CO-Search 在第一轮和第二轮的数据集上,在若干关键指标上取得顶尖性能:归一化折损累计增益、准确率、平均准确率均值和二元偏好。

关键词

引用

@article{arxiv.2006.09595,
  title  = {CO-Search: COVID-19 Information Retrieval with Semantic Search, Question Answering, and Abstractive Summarization},
  author = {Andre Esteva and Anuprit Kale and Romain Paulus and Kazuma Hashimoto and Wenpeng Yin and Dragomir Radev and Richard Socher},
  journal= {arXiv preprint arXiv:2006.09595},
  year   = {2020}
}