无监督关键词抽取中的检索-效率权衡
信息检索
2023-12-25 v1
摘要
高效识别代表给定文档的关键短语是一项具有挑战性的任务。近年来,提出了大量关键词检测方法。这些方法可基于例如词元的统计(频率)特性、专门的神经语言模型,或源自给定文档的图结构。图基方法在计算上可属于最高效的方法之列,同时保持检索性能。图基方法的一个共同主要特性是它们将词元空间即时转换为图,随后进行处理。在本文中,我们探索了一种新颖的无监督方法,其在构建词元图之前以序列形式合并文档的若干部分。此外,通过利用个性化 PageRank(在节点排序时考虑此类子短语的频率及词元长度),我们展示了最先进的检索能力,同时比当前最先进的无监督检测器(如 YAKE 和 MultiPartiteRank)快达两个数量级。所提方法的可扩展性也通过计算一个由 1400 万篇文档组成的生物医学语料库的关键短语得到证明,耗时不到一分钟。
引用
@article{arxiv.2208.07262,
title = {Retrieval-efficiency trade-off of Unsupervised Keyword Extraction},
author = {Blaž Škrlj and Boshko Koloski and Senja Pollak},
journal= {arXiv preprint arXiv:2208.07262},
year = {2023}
}