人工评分是摘要评估的最佳准则吗
计算与语言
2021-01-01 v1
摘要
通常,摘要质量度量会与人工标注者给出的质量分数进行比较。与人工分数的更高相关性被视为更好度量的合理指标。我们讨论了对此观点提出质疑的观察结果。我们尝试展示一种替代指标的可能性。给定一族度量,我们探索一种不依赖于与人工分数相关性的最佳度量选择准则。我们对 BLANC 度量族的观察表明,该准则在不同风格的摘要中具有普适性。
引用
@article{arxiv.2012.14602,
title = {Is human scoring the best criteria for summary evaluation?},
author = {Oleg Vasilyev and John Bohannon},
journal= {arXiv preprint arXiv:2012.14602},
year = {2021}
}
备注
7 pages, 5 figures, 1 table