学术语料库中主题、引用与主题权威的联合建模
计算与语言
2017-06-05 v1 数字图书馆
社会与信息网络
摘要
科学进步大多源于先前发表的研究成果,但在浩瀚的科学出版物海洋中进行搜索十分困难。我们常依赖学术权威指标来寻找杰出作者,但这些权威指数并不根据研究主题区分权威性。我们提出潜在主题权威索引(LTAI),用于联合建模学术论文语料库中的主题、引用和主题权威。与以往模型相比,LTAI 有两个主要不同之处。第一,它显式建模引用的生成过程,而非将引用视为给定。第二,它基于被引论文和施引论文的主题来建模每位作者对论文引用的影响。我们将 LTAI 拟合到四个学术语料库:CORA、Arxiv Physics、PNAS 和 Citeseer。我们将 LTAI 的性能与多种基线进行比较,从潜在 Dirichlet 分配开始,到更高级的模型,包括作者-链接主题模型和动态作者引用主题模型。结果表明,在预测出版物的词语、引用和作者时,LTAI 比其他类似模型取得了更高的准确率。
引用
@article{arxiv.1706.00593,
title = {Joint Modeling of Topics, Citations, and Topical Authority in Academic Corpora},
author = {Jooyeon Kim and Dongwoo Kim and Alice Oh},
journal= {arXiv preprint arXiv:1706.00593},
year = {2017}
}
备注
Accepted by Transactions of the Association for Computational Linguistics (TACL); to appear