中文

度量在低分段范围内同样不一致:重访摘要评估度量

计算与语言 2020-11-10 v1 人工智能

摘要

在文本摘要中,无需人工判断而评估自动度量效能的做法近期变得流行。一项代表性工作得出结论:当对高分段摘要排序时,自动度量强烈不一致。本文中,我们重访其实验并发现,其观察结果源于度量在对任意狭窄分段范围内的摘要排序时均不一致。我们假设这可能是因为摘要在狭窄分段范围内彼此相似,因而难以排序。除摘要分段范围的宽度外,我们分析了影响度量间一致性的另外三个属性——摘要易度、抽象性与覆盖度。为鼓励可复现研究,我们公开了所有分析代码与数据。

关键词

引用

@article{arxiv.2011.04096,
  title  = {Metrics also Disagree in the Low Scoring Range: Revisiting Summarization Evaluation Metrics},
  author = {Manik Bhandari and Pranav Gour and Atabak Ashfaq and Pengfei Liu},
  journal= {arXiv preprint arXiv:2011.04096},
  year   = {2020}
}

备注

Accepted at COLING 2020