德国商业注册表中基于类的关键词提取改进方法研究
计算与语言
2024-07-22 v1
摘要
关键词提取通常是无监督信息抽取中的重要初始步骤,构成诸如主题建模或文档分类等任务的基础。虽然最近的方法在关键词提取方面已相当有效,但标识特定类的关键词,或仅提取描述特定类的关键词,仍具有挑战性。在本文中,我们提出一种改进的类特定关键词提取方法,该方法基于流行的 库,用于从由 描述的类中识别仅与该类相关的关键词。我们使用德国商业注册条目数据集进行测试,其中目标是根据经济部门对每个商业实体进行分类。我们的结果表明,我们的方法在先前方法上取得了显著改进,为类特定关键词提取树立了新标准。
引用
@article{arxiv.2407.14085,
title = {An Improved Method for Class-specific Keyword Extraction: A Case Study in the German Business Registry},
author = {Stephen Meisenbacher and Tim Schopf and Weixin Yan and Patrick Holl and Florian Matthes},
journal= {arXiv preprint arXiv:2407.14085},
year = {2024}
}
备注
7 pages, 1 figure, 1 table. Accepted to KONVENS 2024