中文

主动评估:基于少量成对比较的高效NLG评估

计算与语言 2022-04-19 v2 人工智能 机器学习

摘要

近期研究显示了使用成对比较而非直接评估来评价 NLG 系统的优势。给定 kk 个系统,识别排名第一系统的朴素方法是从所有 (k2){k \choose 2} 个系统对中均匀获取成对比较。然而,这可能非常昂贵,因为所需人工标注数量将随 kk 二次增长。在这项工作中,我们引入主动评估(Active Evaluation),一个通过使用对决赌博机算法主动选择待比较系统对来高效识别排名第一系统的框架。我们在跨越 5 项任务的 13 个 NLG 评估数据集上对 13 种对决赌博机算法进行了大量实验,表明人工标注数量可减少 80%。为进一步减少人工标注数量,我们提出了基于模型的对决赌博机算法,其将自动评估指标与人工评估相结合。具体而言,我们在人工标注过程之前就剔除次优系统,并仅在自动指标高度不确定的测试样本上执行人工评估。这进一步将所需人工标注数量减少 89%。实际上,我们表明识别排名第一系统仅需数百个人工标注,且随 kk 线性增长。最后,我们提供高效识别排名第一系统的实用建议与最佳实践。我们的代码已公开于 https://github.com/akashkm99/duelnlg

关键词

引用

@article{arxiv.2203.06063,
  title  = {Active Evaluation: Efficient NLG Evaluation with Few Pairwise Comparisons},
  author = {Akash Kumar Mohankumar and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2203.06063},
  year   = {2022}
}

备注

Accepted at ACL 2022; 21 pages and 12 figures