中文

概念的熵选择揭示文档语料库中的隐藏主题

物理与社会 2018-05-18 v2 计算与语言 数字图书馆 社会与信息网络

摘要

由于可以从科学文献中提取大量信息(如论文间的引用和研究者间的合著关系),科学的组织与演化最近本身已成为科学定量研究的对象。然而,只有少数研究关注于表征完整文档且可被提取和分析的概念,这些概念能够揭示科学知识的深层组织。遗憾的是,某些概念在文档间可能极为普遍,以至于它们阻碍了文档语料库底层主题结构的涌现,因为它们在文档间产生了大量虚假且平庸的关联。为了识别并移除这些普遍概念,我们引入了一种方法,根据与它们在文档语料库中出现统计相关的客观信息论度量来衡量其相关性。在逐步移除根据该度量可被视为通用的概念后,我们发现主题组织展示出了相应更为精细的结构。

关键词

引用

@article{arxiv.1705.06510,
  title  = {Entropic selection of concepts unveils hidden topics in documents corpora},
  author = {Andrea Martini and Alessio Cardillo and Paolo De Los Rios},
  journal= {arXiv preprint arXiv:1705.06510},
  year   = {2018}
}

备注

Main + SI. Major overhaul after first round of review