PatternRank:利用预训练语言模型和词性进行无监督关键短语抽取
计算与语言
2023-01-03 v2 人工智能
摘要
关键短语抽取是从给定文本中自动选择一小部分最相关短语的过程。有监督的关键短语抽取方法需要大量标注训练数据,并且在训练数据所属领域之外表现不佳。在本文中,我们提出了 PatternRank,它利用预训练语言模型和词性从单篇文档中进行无监督关键短语抽取。我们的实验表明,PatternRank 比以前的 SOTA 方法获得了更高的精确率、召回率和 F1 分数。此外,我们提出了 KeyphraseVectorizers 包,该包允许轻松修改候选关键短语选择的词性模式,从而使我们的方法能够适应任何领域。
关键词
引用
@article{arxiv.2210.05245,
title = {PatternRank: Leveraging Pretrained Language Models and Part of Speech for Unsupervised Keyphrase Extraction},
author = {Tim Schopf and Simon Klimek and Florian Matthes},
journal= {arXiv preprint arXiv:2210.05245},
year = {2023}
}
备注
Accepted to 14th International Joint Conference on Knowledge Discovery, Knowledge Engineering and Knowledge Management - KDIR