基于文本挖掘方法的 COVID-19 文献挖掘与检索
信息检索
2022-05-31 v1 计算与语言
摘要
新型冠状病毒病(COVID-19)于2019年底在中国武汉出现,迄今已感染全球超过1.48亿人,导致312万人死亡。2020年3月10日,世界卫生组织(WHO)宣布其为全球大流行。许多学者和研究人员开始发表描述 COVID-19 最新发现的论文。大量文献的涌入使其他研究人员难以浏览海量数据并找到有助于其研究的合适文献。因此,所提模型试图从庞大的研究论文语料库中提取相关标题,从而简化研究人员的工作。艾伦人工智能研究所发布了 CORD-19 数据集,该数据集包含来自 PubMed 的 PMC、WHO(世界卫生组织)、bioRxiv 和 medRxiv 预印本的20万篇与冠状病毒相关的研究出版物。除该文档语料库外,他们还提供了一个名为 topics-rnd3 的主题数据集,其中包含一系列主题。每个主题有三种表示形式:查询、问题和叙述。这些数据集已开放用于研究,并且他们在 Kaggle 上发布了 TREC-COVID 竞赛。利用这些作为查询的主题,我们的目标是在 CORD-19 数据集中找出相关文档。在本研究中,应针对 topics-rnd3 数据集中提出的主题识别相关文档。所提模型使用自然语言处理(NLP)技术,如词袋模型、平均 Word-2-Vec、平均 BERT Base 模型和 Tf-Idf 加权 Word2Vec 模型,为查询、问题、叙述及其组合构建向量。类似地,为 CORD-19 数据集中的标题构建向量。构建向量后,使用余弦相似度来寻找每两个向量之间的相似性。余弦相似度帮助我们为给定主题找到相关文档。
引用
@article{arxiv.2205.14781,
title = {COVID-19 Literature Mining and Retrieval using Text Mining Approaches},
author = {Sanku Satya Uday and Satti Thanuja Pavani and T. Jaya Lakshmi and Rohit Chivukula},
journal= {arXiv preprint arXiv:2205.14781},
year = {2022}
}