重访黄金标准:以稳健人工评估夯实摘要评测
计算与语言
2023-06-07 v2
摘要
人工评估是摘要系统与自动指标评测的共同基石。然而,现有的摘要人工评估研究要么标注者间一致性较低,要么规模不足,且缺乏对人工评估的深入分析。因此,我们沿以下维度弥补现有摘要评估的不足:(1) 我们提出了一种改进的摘要显著性协议,原子内容单元(ACUs),其基于细粒度语义单元并允许高标注者间一致性。(2) 我们构建了稳健摘要评估(RoSE)基准,一个大型人工评估数据集,包含三个数据集上 28 个顶尖系统的 22,000 条摘要级标注。(3) 我们对四种人工评估协议进行了比较研究,强调了评估设置中潜在的混淆因素。(4) 我们使用所收集的人工标注跨评估协议评估了 50 个自动指标及其变体,并展示了我们的基准如何带来更具统计稳定性和显著性的结果。我们所基准测试的 metrics 包括基于大语言模型(LLMs)的近期方法 GPTScore 和 G-Eval。此外,我们的发现对评估 LLMs 具有重要启示,因为我们表明经人类反馈调整的 LLMs(如 GPT-3.5)可能过拟合无约束的人工评估,后者受标注者先验的、与输入无关的偏好影响,亟需更稳健、有针对性的评估方法。
引用
@article{arxiv.2212.07981,
title = {Revisiting the Gold Standard: Grounding Summarization Evaluation with Robust Human Evaluation},
author = {Yixin Liu and Alexander R. Fabbri and Pengfei Liu and Yilun Zhao and Linyong Nan and Ruilin Han and Simeng Han and Shafiq Joty and Chien-Sheng Wu and Caiming Xiong and Dragomir Radev},
journal= {arXiv preprint arXiv:2212.07981},
year = {2023}
}
备注
ACL 2023 Camera Ready