从科学文献中无监督提取代表性概念
信息检索
2017-11-10 v3
摘要
本文研究从科学文章标题中自动分类与提取科学概念,以更深入理解其核心贡献并促进通用学术知识库的构建。为此,我们提出一种无监督、领域无关且可扩展的两阶段算法,将关键概念提及分类并提取到感兴趣方面(如技术、应用等)。在算法第一阶段,我们提出 PhraseType,一种利用文本特征和有限词性标注将文本片段宽泛分割为方面类型短语的概率生成模型。我们将该模型扩展为在多领域语料中同时学习方面特定特征并识别学术领域,因为这两项任务相互增强。在第二阶段,我们提出一种基于适配器语法的方法,从方面类型短语中提取细粒度概念提及,无需任何外部资源或人工投入,完全以数据驱动方式进行。我们将该技术应用于研究来自不同科学领域的文献,并展示其相较于当前最先进概念提取技术的显著提升。我们还对所得结果进行了定性分析。
引用
@article{arxiv.1710.02271,
title = {Unsupervised Extraction of Representative Concepts from Scientific Literature},
author = {Adit Krishnan and Aravind Sankar and Shi Zhi and Jiawei Han},
journal= {arXiv preprint arXiv:1710.02271},
year = {2017}
}
备注
Published as a conference paper at CIKM 2017