中文

如何为高效的人类评估选择数据点?

计算与语言 2025-06-03 v2

摘要

人类评估是评估文本生成模型的黄金标准。然而,它昂贵。为了适应预算限制,实际中常随机选择测试数据的子集进行评估。然而,随机选择的数据可能不准确地代表测试性能,这种方法在模型比较中经济上效率不高。因此,本文发展并分析了一套选择器,以获取最具信息量的数据点进行人类评估,纳入评估成本的考量。我们表明,基于自动化评分得分方差、模型输出多样性或项目响应理论(Item Response Theory)的选择器优于随机选择。我们进一步发展了一种将这些选择器蒸馏到模型输出尚不可用场景的方法。具体而言,我们引入基于源文本的估计器,仅凭来源文本即可预测项目在人类评估中的有用性。我们在两种常见的 NLG 任务中展示了选择器的有效性,机器翻译和摘要生成,表明仅需约70%的测试数据即可获得与完整数据相同的评估结果。

关键词

引用

@article{arxiv.2501.18251,
  title  = {How to Select Datapoints for Efficient Human Evaluation of NLG Models?},
  author = {Vilém Zouhar and Peng Cui and Mrinmaya Sachan},
  journal= {arXiv preprint arXiv:2501.18251},
  year   = {2025}
}