回归基础:关键词抽取中统计与图基词项加权方案的定量分析
机器学习
2022-09-12 v2 人工智能
摘要
词项加权方案在自然语言处理和信息检索中被广泛使用。特别地,词项加权是关键词抽取的基础。然而,揭示每种加权方案优势与不足的评估研究相对较少。事实上,在大多数情况下,研究人员和从业者求助于著名的 tf-idf 作为默认方案,尽管存在其他合适的替代方案,包括图基模型。在本文中,我们在关键词抽取背景下对统计与图基词项加权方法进行了详尽且大规模的实证比较。我们的分析揭示了一些有趣的发现,例如较不为人知的词汇特异性相对于 tf-idf 的优势,或统计与图基方法之间的质性差异。最后,基于我们的发现,我们讨论并给出了一些给从业者的建议。用于复现我们实验结果(包括一个关键词抽取库)的源代码可在以下仓库获取:https://github.com/asahi417/kex
引用
@article{arxiv.2104.08028,
title = {Back to the Basics: A Quantitative Analysis of Statistical and Graph-Based Term Weighting Schemes for Keyword Extraction},
author = {Asahi Ushio and Federico Liberatore and Jose Camacho-Collados},
journal= {arXiv preprint arXiv:2104.08028},
year = {2022}
}
备注
Accepted by EMNLP 2021 main conference