中文

受约束主动抽样的人类评估方法

计算与语言 2024-06-13 v1 机器学习

摘要

人类评估被视为 NLG 可靠评估方法,但其昂贵且耗时的。为节省劳动力和成本,研究者通常在数据子集上执行人类评估。然而,不同的选择子集会导致系统排名不同。为获得更准确的系统排名并使黄金标准人类评估更可靠,我们提出了受约束主动抽样框架(CASF)用于可靠的人类判断。CASF 通过 Learner、Systematic Sampler 和 Constrained Controller 三个组件运作,以选择代表性样本以获得更准确的系统排名。在 137 个真实 NLG 评估场景中进行了实验,涵盖 44 个人类评估指标,16 个数据集和 5 个 NLG 任务。实验结果表明,CASF 在 93.18% 的系统识别中获得一等奖,90.91% 的人类指标中位列第一或第二,整体系统排名 Kendall 相关系数达 0.83。代码和数据已公开。

关键词

引用

@article{arxiv.2406.07967,
  title  = {Better than Random: Reliable NLG Human Evaluation with Constrained Active Sampling},
  author = {Jie Ruan and Xiao Pu and Mingqi Gao and Xiaojun Wan and Yuesheng Zhu},
  journal= {arXiv preprint arXiv:2406.07967},
  year   = {2024}
}

备注

With Appendix