受约束主动抽样的人类评估方法
计算与语言
2024-06-13 v1 机器学习
摘要
人类评估被视为 NLG 可靠评估方法,但其昂贵且耗时的。为节省劳动力和成本,研究者通常在数据子集上执行人类评估。然而,不同的选择子集会导致系统排名不同。为获得更准确的系统排名并使黄金标准人类评估更可靠,我们提出了受约束主动抽样框架(CASF)用于可靠的人类判断。CASF 通过 Learner、Systematic Sampler 和 Constrained Controller 三个组件运作,以选择代表性样本以获得更准确的系统排名。在 137 个真实 NLG 评估场景中进行了实验,涵盖 44 个人类评估指标,16 个数据集和 5 个 NLG 任务。实验结果表明,CASF 在 93.18% 的系统识别中获得一等奖,90.91% 的人类指标中位列第一或第二,整体系统排名 Kendall 相关系数达 0.83。代码和数据已公开。
引用
@article{arxiv.2406.07967,
title = {Better than Random: Reliable NLG Human Evaluation with Constrained Active Sampling},
author = {Jie Ruan and Xiao Pu and Mingqi Gao and Xiaojun Wan and Yuesheng Zhu},
journal= {arXiv preprint arXiv:2406.07967},
year = {2024}
}
备注
With Appendix