中文

基于 LLM 的评估器是否混淆了 NLG 质量标准?

计算与语言 2024-07-01 v2

摘要

先前的一些工作表明,LLM 在不同任务的 NLG 评估中表现良好。然而,我们发现 LLM 似乎会混淆不同的评估标准,这降低了其可靠性。为了进一步验证,我们首先考虑避免现有 NLG 质量标准本身中概念不一致和表达模糊的问题。因此,我们总结了包含 11 个常见方面的清晰层级分类体系,并涉及了先前研究中相应的不同标准。受行为测试启发,我们精心设计了 18 种针对特定方面的扰动攻击,用于细粒度分析不同 LLM 的评估行为。我们还进行了超出该分类体系指导的人工标注,以验证扰动的影响。我们的实验结果揭示了 LLM 固有的混淆问题以及其他值得注意的现象,这表明基于 LLM 的评估需要进一步的研究与改进。

关键词

引用

@article{arxiv.2402.12055,
  title  = {Are LLM-based Evaluators Confusing NLG Quality Criteria?},
  author = {Xinyu Hu and Mingqi Gao and Sen Hu and Yang Zhang and Yicheng Chen and Teng Xu and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2402.12055},
  year   = {2024}
}

备注

Accepted by ACL 2024