文本生成中自动化指标偏好评分的误差校正
计算与语言
2023-06-07 v1 人工智能
摘要
文本生成领域的一个主要挑战是评估:人工评估成本高昂,而自动化指标常与人类判断存在显著分歧。本文中,我们提出一个文本生成评估的统计模型,该模型考虑了在用于生成系统输出间偏好排序时自动化指标易出错的特性。我们表明,现有自动化指标在此设定下对判定系统间显著差异普遍过于自信。然而,我们的模型能够高效结合人工与自动化评分,以纠正自动化指标的易错性。我们展示,使用这种组合,我们仅需要评估中通常使用的大约 50% 的人工标注即可获得稳健且统计显著的结果,同时在 95% 的情况下产生与纯人工评估相同的评估结果。我们展示了该方法在三个文本生成任务上的益处:对话系统、机器翻译与文本摘要。
引用
@article{arxiv.2306.03866,
title = {Correction of Errors in Preference Ratings from Automated Metrics for Text Generation},
author = {Jan Deriu and Pius von Däniken and Don Tuggener and Mark Cieliebak},
journal= {arXiv preprint arXiv:2306.03866},
year = {2023}
}