LLM-as-a-Judge 对 LLM 对齐任务的系统性评估:可解释指标与多样化提示模板
计算与语言
2025-04-01 v2
摘要
LLM-as-a-Judge 已被广泛应用于评估和比较不同的 LLM 对齐方法(如 RLHF 和 DPO)。然而,由于 LLM 评判器的偏见和决策不一致性,引发了其可靠性疑虑。以往的研究开发了评估框架来衡量 LLM 评判器的可靠性及其与人类偏好的一致性。然而,所采用的数据评估指标往往缺乏足够的可解释性,未能解决 LLM 内部的不一致性问题。此外,现有研究不充分探索了在应用 LLM-as-a-Judge 方法时,不同提示模板对结果的影响,导致不同对齐算法之间的潜在不一致比较。本文通过定义更具理论可解释性的评估指标,显式地从可靠性指标中缓解 LLM 内部的不一致性,系统性地评估了 LLM-as-a-Judge 在对齐任务中的表现。我们开发了一个开源框架,用于评估、比较和可视化 LLM 评判器的可靠性和对齐程度,帮助实践者选择适用于对齐任务的 LLM 评判器。在实验中,我们检验了多样化提示模板对 LLM 评判器可靠性的影响,并通过在两个常见对齐数据集(即 TL;DR 摘要和 HH-RLHF-Helpfulness)上对 various LLM 评判器进行比较来展示所开发框架。我们的结果表明,提示模板对 LLM 评判器性能具有显著影响,同时 tested LLM 评判器与人类评估者之间的对齐水平仅中等。
引用
@article{arxiv.2408.13006,
title = {Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates},
author = {Hui Wei and Shenghua He and Tian Xia and Fei Liu and Andy Wong and Jingyang Lin and Mei Han},
journal= {arXiv preprint arXiv:2408.13006},
year = {2025}
}
备注
Accepted by Building Trust in LLMs and LLM Applications workshop at ICLR 2025