从平局中得出结论:重新思考竞技场式LLM评估中的偏好语义
计算与语言
2025-10-03 v1
摘要
在竞技场式大语言模型(LLM)评估中,两个LLM对用户查询做出回应,用户选择胜出回应或判定该场"对战"为平局,从而调整两个模型的评分。当前建模这些评分动态的主流方法是将对战视为类似国际象棋的双人博弈,并应用Elo评分系统及其衍生方法。在本文中,我们批判性地审视这一范式。具体而言,我们质疑平局是否真正意味着两个模型相等,以及它们的评分是否应当被均等化。相反,我们猜想平局更多地反映了查询难度:如果查询过于简单,两个模型就更有可能同等成功。我们在三个真实竞技场数据集上表明,忽略平局的评分更新可使四种被研究评分系统的对战结果预测准确率(包括平局在内)相对提升1-3%。进一步分析表明,平局更常出现在被评分为非常简单以及高度客观的查询上,风险比分别为1.37和1.35。我们建议未来的评分系统重新审视现有的平局语义,并在评分更新中考虑查询属性。
引用
@article{arxiv.2510.02306,
title = {Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation},
author = {Raphael Tang and Crystina Zhang and Wenyan Li and Carmen Lai and Pontus Stenetorp and Yao Lu},
journal= {arXiv preprint arXiv:2510.02306},
year = {2025}
}
备注
6 pages, 4 figures