中文

基于无监督关键短语抽取与文档表示学习的 COVID-19 相关文献优先级排序

信息检索 2021-10-19 v1 计算与语言 数字图书馆

摘要

COVID-19 大流行引发了一波新的科学文献浪潮,在合理的时间框架内人工审阅和研究这些文献是不可能的。当前的机器学习方法可将这些文献主体投影到向量空间中,使相似文档彼此邻近,从而提供对 COVID-19 相关科学论文及其他知识源的有见地的探索。然而,要开始检索,此类文本需要被适当标注,而由于人力匮乏,这种情况很少见。在我们的系统中,当前 COVID-19 相关文献主体使用无监督关键短语抽取进行标注,便于对包含所学文档嵌入(低维表示)的潜空间发起初始查询。该解决方案可通过一个能够进行交互式检索、术语排序和潜在有趣文献探索的 Web 服务器访问。我们通过药物化学领域的案例研究展示了该方法的有用性。

关键词

引用

@article{arxiv.2110.08874,
  title  = {Prioritization of COVID-19-related literature via unsupervised keyphrase extraction and document representation learning},
  author = {Blaž Škrlj and Marko Jukič and Nika Eržen and Senja Pollak and Nada Lavrač},
  journal= {arXiv preprint arXiv:2110.08874},
  year   = {2021}
}