面向更好可解释性的双视角 NLG 元评估框架及自动基准
计算与语言
2025-08-18 v2
摘要
在 NLG 元评估中,评估指标通常基于其与人类的一致性进行评估。然而,我们识别出传统 NLG 元评估方法存在一些局限性,例如在处理人类评分和选择相关性度量标准方面的问题,这些局限性削弱了元评估的有效性。本文中,我们提出了双视角 NLG 元评估框架,关注不同的评估能力,从而提供更好的可解释性。此外,我们引入了一种无需新人类标注即可构建相应基准的方法。进一步地,我们基于我们提出的框架,对 16 个代表性大语言模型(LLM)作为评估器进行了实验,全面分析了其从不同视角的评估性能。
引用
@article{arxiv.2502.12052,
title = {A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better Interpretability},
author = {Xinyu Hu and Mingqi Gao and Li Lin and Zhenghan Yu and Xiaojun Wan},
journal= {arXiv preprint arXiv:2502.12052},
year = {2025}
}
备注
Accepted by ACL 2025