利用词嵌入改进 ROUGE 的摘要评估
计算与语言
2015-08-26 v1 信息检索
摘要
ROUGE 是一种被广泛采用的文本摘要自动评估指标。尽管已证明它与人类判断具有良好的相关性,但它偏向于表面词汇相似性。这使其不适合用于评估生成式摘要或包含大量改写的摘要。我们研究了词嵌入在克服 ROUGE 这一缺点方面的有效性。具体而言,不再测量词汇重叠,而是使用词嵌入来计算摘要中所用词语的语义相似度。我们的实验结果表明,当使用 Spearman 和 Kendall 秩相关系数进行测量时,我们的方法能够与人类判断实现更好的相关性。
引用
@article{arxiv.1508.06034,
title = {Better Summarization Evaluation with Word Embeddings for ROUGE},
author = {Jun-Ping Ng and Viktoria Abrecht},
journal= {arXiv preprint arXiv:1508.06034},
year = {2015}
}
备注
Pre-print - To appear in proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP)