从科学文献中高精度抽取新兴概念
信息检索
2021-03-24 v1 计算与语言
摘要
识别科学文献中的新概念有助于推动分面搜索、科学趋势分析、知识库构建等,但现有方法有所欠缺。人工识别无法跟上新发表文献的洪流,而现有自动技术的精度过低以致许多应用无法使用。我们提出一种用于科学文献的无监督概念抽取方法,其精度远超先前工作。我们的方法依赖于一个简单但新颖的直觉:每个科学概念很可能由一篇被后续提及该概念的论文不成比例大量引用的论文引入或推广。从 arXiv 上的计算机科学论文语料中,我们发现我们的方法在 Precision@1000 上达到99%,而先前工作为86%,并且在前15000次抽取中取得了明显更优的精度-产出权衡。为刺激该领域研究,我们发布了代码与数据(https://github.com/allenai/ForeCite)。
引用
@article{arxiv.2006.06877,
title = {High-Precision Extraction of Emerging Concepts from Scientific Literature},
author = {Daniel King and Doug Downey and Daniel S. Weld},
journal= {arXiv preprint arXiv:2006.06877},
year = {2021}
}
备注
Accepted to SIGIR 2020