重新审视自动摘要评测指标的系统级相关性
计算与语言
2022-04-22 v1
摘要
自动摘要评测指标在多大程度上能复现人类对摘要质量判断的可靠性,由系统级相关性来量化。我们指出了系统级相关性的定义在两个方面与实践中利用指标评测系统的用法不一致,并提出了弥补这一脱节的改变。首先,我们使用完整测试集而非当前标准做法下人类所评判的摘要子集来计算自动指标的系统得分。我们展示了这一微小改变如何带来更精确的系统级相关性估计。其次,我们提议仅在自动得分差异较小(实践中常见)的系统对上计算相关性。这使我们能够表明,在现实场景中,我们对 ROUGE 与人类判断相关性的最佳估计接近于 0。分析结果指出,在系统得分差异较小时,需要收集更多高质量人类判断并改进自动指标。
引用
@article{arxiv.2204.10216,
title = {Re-Examining System-Level Correlations of Automatic Summarization Evaluation Metrics},
author = {Daniel Deutsch and Rotem Dror and Dan Roth},
journal= {arXiv preprint arXiv:2204.10216},
year = {2022}
}