关键短语生成中的数据集、指标与模型分析
信息检索
2025-06-13 v1 计算与语言
摘要
关键短语生成是指生成一组能够概括文档内容的词语或短语的任务。过去几年中,针对该任务持续投入了大量精力,涵盖了多个研究方向,如模型架构、数据资源和应用场景。然而,关键短语生成的当前状态尚不明确,因为此前尚无对以往工作进行回顾和分析的尝试。本研究通过呈现对50多篇关键短语生成研究论文的分析,弥补了这一空白,全面概述了近期进展、局限性与开放挑战。我们的发现揭示了当前评估实践中存在的若干关键问题,例如常用基准数据集之间令人担忧的相似性以及指标计算的不一致性导致性能被高估。此外,我们通过发布一个基于PLM的强关键短语生成模型来解决预训练模型可用性有限的问题,以促进未来研究。
引用
@article{arxiv.2506.10346,
title = {An Analysis of Datasets, Metrics and Models in Keyphrase Generation},
author = {Florian Boudin and Akiko Aizawa},
journal= {arXiv preprint arXiv:2506.10346},
year = {2025}
}
备注
GEM^2 paper @ ACL 2025