RevisEval:通过响应适应参考提升 LLM 作为评判者的效果
计算与语言
2025-04-08 v3
摘要
在近期研究中,LLM 作为评判者已成为一种高性价比的替代方案,用于评估文本生成质量在广泛的任务中。然而,LLM 作为评判者与人类评估之间仍存在可靠性差距。一个重要原因是评估过程中缺乏引导性参考。在经典文本评估中广泛使用的参考方案是激发我们引入 RevisEval,这是一种通过响应适应参考的文本生成评估范式。RevisEval 的驱动核心观察是:理想的参考应与待评估的响应保持必要的相关性。具体而言,RevisEval 利用大型语言模型(LLM)的文本修订能力,对响应进行自适应修订,然后将修订后的文本作为后续评估的参考(响应适应参考)。广泛实验表明,RevisEval 在 NLG 任务和开放式指令遵循任务中超越了传统的无参考和基于参考的评估范式(这些范式使用 LLM 作为评判者)。更重要的是,我们的响应适应参考还能进一步提升经典文本指标,如 BLEU 和 BERTScore,与传统参考相当乃至与 LLM 作为评判者一道。我们还对 RevisEval 在偏好减少、推理成本和参考相关性方面的效果进行了详细分析。
引用
@article{arxiv.2410.05193,
title = {RevisEval: Improving LLM-as-a-Judge via Response-Adapted References},
author = {Qiyuan Zhang and Yufei Wang and Tiezheng YU and Yuxin Jiang and Chuhan Wu and Liangyou Li and Yasheng Wang and Xin Jiang and Lifeng Shang and Ruiming Tang and Fuyuan Lyu and Chen Ma},
journal= {arXiv preprint arXiv:2410.05193},
year = {2025}
}