LitMC-BERT:基于Transformer的生物医学文献多标签分类及其在COVID-19文献整理中的应用
计算与语言
2022-04-20 v1 人工智能
摘要
生物医学文献的快速增长给整理与解读带来了重大挑战。在COVID-19大流行期间,这一点变得更为明显。LitCovid是PubMed中COVID-19相关论文的文献数据库,已累积超过180,000篇文章,访问量达数百万次。每月约有10,000篇新文章被加入LitCovid。LitCovid中的一项主要整理任务是主题标注,即为一篇文章分配最多八个主题,例如治疗与诊断。所标注的主题已广泛应用于LitCovid(例如约占总使用量的18%)以及网络生成等下游研究中。然而,由于该任务的性质及文献的快速增长,它已成为主要的整理瓶颈。本研究提出LITMC-BERT,一种基于Transformer的生物医学文献多标签分类方法。它对所有标签使用共享的Transformer主干,同时捕获标签特定特征及标签对之间的相关性。我们在两个数据集上将LITMC-BERT与三种基线模型进行比较。其micro-F1与基于样本的F1分别比当前最佳结果高5%和4%,且推理时间仅需Binary BERT基线的约18%。相关数据集与模型可通过https://github.com/ncbi/ml-transformer获取。
引用
@article{arxiv.2204.08649,
title = {LitMC-BERT: transformer-based multi-label classification of biomedical literature with an application on COVID-19 literature curation},
author = {Qingyu Chen and Jingcheng Du and Alexis Allot and Zhiyong Lu},
journal= {arXiv preprint arXiv:2204.08649},
year = {2022}
}