谁决定“最佳”?面向交互式、用户定义的 LLM 评估排行榜
人工智能
2026-04-24 v1 计算机与社会
人机交互
摘要
LLM 评估排行榜广泛用于比较模型并指导部署决策。然而,排行榜排名由评估优先事项由基准设计师设定,而非由实际用户和组织所具有的多样化目标和约束所主导。单个综合分数往往掩盖了模型在不同提示类型和组合上的行为差异。本文我们对 LMArena(此前称为 Chatbot Arena)基准测试中所使用的数据集进行深入分析,调查这一评估挑战,通过设计一个交互式可视化界面作为设计探针。我们的分析显示,该数据集在特定主题上存在显著偏斜,模型排名在不同提示切片上存在差异,偏好基准的判断在其意图范围内的模糊化。基于这一分析,我们引入了一个可视化界面,允许用户通过选择和加权提示切片来定义自己的评估优先事项,并探索相应的排名变化。定性研究表明,这种交互式方法提高了透明度,支持更具上下文特定性的模型评估,指向重新设计和使用 LLM 排行榜的替代方式。
引用
@article{arxiv.2604.21769,
title = {Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards},
author = {Minji Jung and Minjae Lee and Yejin Kim and Sarang Choi and Minsuk Kahng},
journal= {arXiv preprint arXiv:2604.21769},
year = {2026}
}
备注
Accepted to the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT 2026)