探究 LLM-as-a-Judge 中的非传递性
人工智能
2025-06-09 v3 计算与语言
机器学习
摘要
基于大语言模型 (LLMs) 的自动评估方法正成为评估基于 LLM 的智能体指令遵循能力的标准工具。该范式中最常见的方法——与基线模型的成对比较——关键依赖于传递性偏好这一假设。然而,该假设的有效性在很大程度上仍未得到探索。在本研究中,我们探究了 AlpacaEval 框架内非传递性的存在,并分析了其对模型排名的影响。我们发现 LLM 评判者表现出非传递性偏好,导致排名对基线模型的选择敏感。为缓解此问题,我们证明循环赛结合 Bradley-Terry 偏好模型可以产生更可靠的排名。值得注意的是,我们的方法将 Spearman 相关系数和 Kendall 相关系数与 Chatbot Arena 的相关性分别从 95.0% 提高到 96.4%,从 82.1% 提高到 86.3%。为了解决循环赛的计算成本问题,我们提出了 Swiss-Wise Iterative Matchmaking (Swim) 锦标赛,使用动态匹配策略来捕获循环赛的优势,同时保持计算效率。
引用
@article{arxiv.2502.14074,
title = {Investigating Non-Transitivity in LLM-as-a-Judge},
author = {Yi Xu and Laura Ruis and Tim Rocktäschel and Robert Kirk},
journal= {arXiv preprint arXiv:2502.14074},
year = {2025}
}
备注
ICML 2025 (Spotlight)