中文

一种用于分析排行榜稳定性与操纵的统一扰动框架

机器学习 2026-05-18 v1

摘要

诸如 LMArena 之类的评估排行榜通过将成对的人类偏好聚合成模型排名,在大型语言模型基准测试中扮演着核心角色,然而这些排名的鲁棒性仍然知之甚少。我们提出了一个统一的扰动框架,用于在结构化数据修改下,使用基于影响的近似方法分析 Bradley-Terry 排行榜。我们的框架研究了三种匹配级别的扰动——删除、添加和翻转——以及玩家移除,并评估了它们对 top-k 成员资格、通过 Kendall's tau 衡量的全局排名一致性以及基于置信区间的不确定性的影响。在 Chatbot Arena 和另外六个成对比较数据集上,我们表明现代排行榜在所有三个目标上都是非鲁棒的:低于 1% 的定向扰动就能改变排名第一的模型、降低 Kendall's tau 并改变置信区间。除了鲁棒性审计之外,我们还表明,相同的影响分数能够实现高效的定向扰动,以提升或降级特定模型,并以比先前操纵和主动采样基线更少的操作减少目标模型的不确定性。通过使用归一化的数据集级鲁棒性分数总结这些影响,我们的框架为审计排行榜稳定性并推动更鲁棒的评估协议提供了一个实用且有用的工具。

关键词

引用

@article{arxiv.2605.15761,
  title  = {A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation},
  author = {Hosna Oyarhoseini and Jimmy Lin and Amir-Hossein Karimi},
  journal= {arXiv preprint arXiv:2605.15761},
  year   = {2026}
}