中文

基于深度注意力神经网络的大规模学术论文学科分类

计算与语言 2020-07-29 v1 数字图书馆

摘要

学术论文的学科类别通常指论文所属的知识领域,例如计算机科学或物理学。学科类别信息可用于为数字图书馆搜索引擎构建分面搜索,这能显著帮助用户缩小相关文献的检索范围。遗憾的是,许多学术论文的元数据中并不包含此类信息。现有解决该任务的方法通常侧重于依赖引文网络的无监督学习,然而,引用当前论文的完整论文列表可能不易获得,特别是那些引用很少或没有引用的新论文无法用此类方法分类。本文提出一种深度注意力神经网络(DANN),仅利用摘要对学术论文进行分类。该网络使用来自 Web of Science (WoS) 的 900 万篇摘要进行训练,并采用涵盖 104 个学科类别的 WoS 体系。所提网络由两个双向循环神经网络和一个注意力层组成。我们通过改变架构和文本表示将模型与基线进行比较。我们的最佳模型取得了 0.76 的 micro-F1 值,各学科的 F1 介于 0.50–0.95 之间。结果表明重新训练词嵌入模型以最大化词汇重叠的重要性,以及注意力机制的有效性。词向量与 TFIDF 的组合优于字符级和句子级嵌入模型。我们讨论了样本不平衡与类别重叠问题,并给出可能的缓解策略。我们还通过对一百万篇学术论文的随机样本进行分类,确定了 CiteSeerX 中的学科类别分布。

关键词

引用

@article{arxiv.2007.13826,
  title  = {Large Scale Subject Category Classification of Scholarly Papers with Deep Attentive Neural Networks},
  author = {Bharath Kandimalla and Shaurya Rohatgi and Jian Wu and C Lee Giles},
  journal= {arXiv preprint arXiv:2007.13826},
  year   = {2020}
}

备注

submitted to "Frontiers Mining Scientific Papers Volume II: Knowledge Discovery and Data Exploitation"