KEA:实用的自动关键短语提取
数字图书馆
2016-08-31 v1
摘要
关键短语提供总结和表征文档的语义元数据。本文描述了Kea,一种从文本中自动提取关键短语的算法。Kea使用词汇方法识别候选关键短语,计算每个候选的特征值,并使用机器学习算法预测哪些候选是好的关键短语。机器学习方案首先使用已知关键短语的训练文档构建预测模型,然后使用该模型在新文档中查找关键短语。我们使用大型测试语料库来评估Kea在正确识别多少作者分配的关键短语方面的有效性。该系统简单、健壮且公开可用。
引用
@article{arxiv.cs/9902007,
title = {KEA: Practical Automatic Keyphrase Extraction},
author = {Ian H. Witten and Gordon W. Paynter and Eibe Frank and Carl Gutwin and Craig G. Nevill-Manning},
journal= {arXiv preprint arXiv:cs/9902007},
year = {2016}
}
备注
9 pages