自然语言评估中去偏自动度量的代价
计算与语言
2018-07-09 v1
摘要
为评估生成系统,诸如 BLEU 的自动度量运行成本为零,但已被证明与人类判断相关性很差,导致针对某些模型改进的系统性偏差。另一方面,平均人类判断这一无偏金标准往往过于昂贵。本文中,我们使用控制变量法将自动度量与人类评估结合,以获得比单独人类评估成本更低的无偏估计量。然而在实践中,我们在评估摘要与开放回答问答系统时仅获得了 7-13% 的成本降低。随后我们证明该估计量是最优的:不存在成本更低的无偏估计量。我们的理论进一步凸显了两个基本瓶颈——自动度量以及展示给人类评估者的提示——二者均需改进方能获得更大的成本节约。
引用
@article{arxiv.1807.02202,
title = {The price of debiasing automatic metrics in natural language evaluation},
author = {Arun Tejasvi Chaganty and Stephen Mussman and Percy Liang},
journal= {arXiv preprint arXiv:1807.02202},
year = {2018}
}
备注
To appear ACL 2018