中文

面向 COVID-19 文献的文档分类

信息检索 2020-09-11 v2 计算与语言

摘要

全球大流行使得快速准确地检索相关科学文献以供广泛领域研究人员有效利用变得比以往任何时候都更为重要。我们对 LitCovid 数据集上的若干多标签文档分类模型进行了分析,该数据集是一个不断增长的、包含 23,000 篇关于 2019 新型冠状病毒的研究论文的合集。我们发现,在该数据集上微调的预训练语言模型优于所有其他基线,且 BioBERT 以微小优势超越其他模型,在测试集上的 micro-F1 和准确率分别约为 86% 和 75%。我们评估了这些数据效率和泛化能力,将其视为任何旨在应对如当前卫生危机这类紧急情况系统的关键特征。最后,我们探究了最佳性能模型在 LitCovid 文档上产生的 50 个错误,发现它们经常(1)将某些标签过度紧密地关联在一起,以及(2)未能聚焦于文章中具有判别性的部分;这两者都是未来工作中需要解决的重要问题。数据和代码均已在 GitHub 上公开。

关键词

引用

@article{arxiv.2006.13816,
  title  = {Document Classification for COVID-19 Literature},
  author = {Bernal Jiménez Gutiérrez and Juncheng Zeng and Dongdong Zhang and Ping Zhang and Yu Su},
  journal= {arXiv preprint arXiv:2006.13816},
  year   = {2020}
}

备注

8 pages, 9 figures