基于上下文嵌入将学术文章关键词抽取作为序列标注的研究
计算与语言
2019-10-22 v1
摘要
本文将从学术文章中抽取关键词定义为使用 BiLSTM-CRF 解决的序列标注任务,其中输入文本中的词使用深度上下文嵌入表示。我们在三个不同基准数据集(Inspec、SemEval 2010、SemEval 2017)上利用上下文与固定词嵌入模型评估所提架构,并与现有流行的无监督及有监督技术比较。我们的结果量化了以下益处:(a) 使用上下文嵌入(如 BERT)优于固定词嵌入(如 Glove);(b) 使用带上下文词嵌入的 BiLSTM-CRF 架构优于直接微调上下文词嵌入模型;(c) 使用特定领域上下文嵌入(SciBERT)。通过误差分析,我们也提供了一些关于为何特定模型优于其他模型的见解。最后,我们给出一个案例研究,分析两个最佳模型(BERT 和 SciBERT)的不同自注意力层,以更好理解各自对关键词抽取任务的预测。
引用
@article{arxiv.1910.08840,
title = {Keyphrase Extraction from Scholarly Articles as Sequence Labeling using Contextualized Embeddings},
author = {Dhruva Sahrawat and Debanjan Mahata and Mayank Kulkarni and Haimin Zhang and Rakesh Gosangi and Amanda Stent and Agniv Sharma and Yaman Kumar and Rajiv Ratn Shah and Roger Zimmermann},
journal= {arXiv preprint arXiv:1910.08840},
year = {2019}
}