微调预训练上下文嵌入用于学术出版物中的引文内容分析
计算与语言
2020-09-15 v1 人工智能
摘要
引文功能与引文情感是引文内容分析(CCA)的两个重要方面,对影响力分析和科学出版物推荐很有用。然而,现有研究多为传统机器学习方法,尽管深度学习技术也有所探索,但由于训练数据不足,性能提升似乎不显著,这给应用带来困难。在本文中,我们提出微调预训练上下文嵌入 ULMFiT、BERT 和 XLNet 以完成该任务。在三个公开数据集上的实验表明,我们的策略在 F1 分数上优于所有基线。对于引文功能识别,XLNet 模型在 DFKI、UMICH 和 TKDE2019 数据集上分别达到 87.2%、86.90% 和 81.6%,而在引文情感识别方面于 DFKI 和 UMICH 上分别达到 91.72% 和 91.56%。我们的方法可用于增强学者及学术出版物的影响力分析。
引用
@article{arxiv.2009.05836,
title = {Fine-tuning Pre-trained Contextual Embeddings for Citation Content Analysis in Scholarly Publication},
author = {Haihua Chen and Huyen Nguyen},
journal= {arXiv preprint arXiv:2009.05836},
year = {2020}
}
备注
1 figure and three tables