仅丢弃极少量偏好数据即可改变大型语言模型排名
机器学习
2026-03-06 v3 机器学习
摘要
我们提出了一种方法,用于评估广泛使用的 LLM 排名系统——即变体——对极小比例偏好数据丢弃的鲁棒性。我们的做法计算快速且易于采纳。当我们将其应用于流行 LLM 排名平台(包括 Chatbot Arena 及其衍生品)的 matchups 时,我们发现顶级模型的排名对偏好数据的微小删除非常敏感;例如,仅删除 0.003% 的人类偏好即可改变 Chatbot Arena 的 top-ranked 模型。我们的鲁棒性检查识别了导致此类排名翻转的最负责任偏好,允许检查这些有影响力的偏好。我们观察到基于 MT-bench 偏好的排名比基于 Chatbot Arena 偏好的排名更具鲁棒性,这可能是由于 MT-bench 使用专家标注员和精心构建的提示造成的。最后,我们发现基于众所周知的人类评估或基于 LLM-as-judge 偏好的排名都不比其他一种更具敏感性。
引用
@article{arxiv.2508.11847,
title = {Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings},
author = {Jenny Y. Huang and Yunyi Shen and Dennis Wei and Tamara Broderick},
journal= {arXiv preprint arXiv:2508.11847},
year = {2026}
}