中文

面向更好可解释性的双视角 NLG 元评估框架及自动基准

计算与语言 2025-08-18 v2

摘要

在 NLG 元评估中,评估指标通常基于其与人类的一致性进行评估。然而,我们识别出传统 NLG 元评估方法存在一些局限性,例如在处理人类评分和选择相关性度量标准方面的问题,这些局限性削弱了元评估的有效性。本文中,我们提出了双视角 NLG 元评估框架,关注不同的评估能力,从而提供更好的可解释性。此外,我们引入了一种无需新人类标注即可构建相应基准的方法。进一步地,我们基于我们提出的框架,对 16 个代表性大语言模型(LLM)作为评估器进行了实验,全面分析了其从不同视角的评估性能。

关键词

引用

@article{arxiv.2502.12052,
  title  = {A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better Interpretability},
  author = {Xinyu Hu and Mingqi Gao and Li Lin and Zhenghan Yu and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2502.12052},
  year   = {2025}
}

备注

Accepted by ACL 2025