中文

SChuBERT:基于 BERT 编码学术文档分块提升引用次数预测

计算与语言 2020-12-23 v1 机器学习

摘要

预测学术文档的引用次数是学术文档处理中一个新兴任务。除了该信息本身的内在价值外,它还作为质量的不完美代理而被更广泛使用,其优势在于可廉价地用于大量学术文档。先前工作使用相对较小的训练集,或使用较大数据集但输入文本较短且不完整的引用次数预测。本工作中,我们利用开放获取的 ACL Anthology 语料库结合 Semantic Scholar 文献计量数据库,构建了一个带有相关引用信息的大型学术文档语料库,并提出了一种称为 SChuBERT 的新引用预测模型。在实验中,我们将 SChuBERT 与几种最先进的引用预测模型比较,表明它以较大优势优于先前方法。我们还展示了使用更多训练数据和更长输入对引用次数预测的益处。

关键词

引用

@article{arxiv.2012.11740,
  title  = {SChuBERT: Scholarly Document Chunks with BERT-encoding boost Citation Count Prediction},
  author = {Thomas van Dongen and Gideon Maillette de Buy Wenniger and Lambert Schomaker},
  journal= {arXiv preprint arXiv:2012.11740},
  year   = {2020}
}

备注

Published at the First Workshop on Scholarly Document Processing, at EMNLP 2020. Minor corrections were made to the workshop version, including addition of color to Figures 1,2