中文

COVID-19 大流行背景下的自监督语义标引方法

信息检索 2020-10-08 v1 计算与语言 机器学习

摘要

大流行加速了 COVID-19 科学论文的发表速度。此外,专家手动为这些论文分配语义标引的过程在当前卫生危机中更加耗时且不堪重负。因此,迫切需要能够在新引入概念上有效扩展并快速适应高度聚焦相关文献演化的自动语义标引模型。在本研究中,我们提出一种基于最先进自监督表示学习和 transformer 编码、专用于大流行危机的新型语义标引方法。我们基于 PubMed 中发表并人工标引的 COVID-19 论文构建的新数据集进行了案例研究。我们的研究表明,我们的自监督模型在微平均 F1 分数上平均优于 BioASQ 任务 8a 的最佳模型 0.1,在 LCA-F 分数上平均优于 0.08。我们的模型在检测补充概念方面也表现出优越性能,这在文献焦点急剧转向大流行相关特定概念时尤为重要。我们的研究揭示了大流行期间语义标引模型面临的主要挑战,即新领域及其分布的剧烈变化,并作为此类情形的更优替代方案,提出了一种基于在多种 NLP 任务中已展现良好泛化与数据效率表现的方法的模型。我们还表明,主要医学主题词(MeSH)与补充概念的联合标引提升了整体性能。

关键词

引用

@article{arxiv.2010.03544,
  title  = {A Self-supervised Approach for Semantic Indexing in the Context of COVID-19 Pandemic},
  author = {Nima Ebadi and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2010.03544},
  year   = {2020}
}