中文

定义与检测人类评估指南中的漏洞:面向可靠 NLG 评估的初步研究

计算与语言 2024-06-13 v1 机器学习

摘要

人类评估是衡量自然语言生成(NLG)系统质量的金标准。然而,作为确保可靠且可重复人类评估的关键要素,评估指南获得了有限的关注。我们的调查发现,仅 29.84% 的近期涉及人类评估的顶会论文公开其评估指南,其中 77.09% 的指南识别出了漏洞。不可靠的评估指南可能导致不准确的评估结果,潜在地阻碍 NLG 的向正确方向发展。为此,我们采取初始步骤,致力于可靠的评估指南,提出了首个人类评估指南数据集,通过收集来自现有论文的指南注释以及由大型语言模型(LLM)生成的指南。我们然后引入了八类漏洞的分类体系,并提出了构建评估指南的原则。此外,探讨了使用 LLM 检测指南漏洞的方法,并提供了一套提高人类评估可靠性的建议。该标注的人类评估指南数据集和用于漏洞检测的方法代码已公开在线上。

关键词

引用

@article{arxiv.2406.07935,
  title  = {Defining and Detecting Vulnerability in Human Evaluation Guidelines: A Preliminary Study Towards Reliable NLG Evaluation},
  author = {Jie Ruan and Wenqing Wang and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2406.07935},
  year   = {2024}
}