中文

通过投票操纵提升聊天机器人竞技场中的模型排名

计算与语言 2025-08-12 v2 人工智能 密码学与安全 机器学习

摘要

聊天机器人竞技场是评估大语言模型的流行平台,通过两两对战让用户投票选择更受欢迎的响应。虽然聊天机器人竞技场被广泛认为是可靠的大语言模型排名榜单,但我们展示了众所周知的投票可以被操纵以提高(或降低)目标模型 mtm_{t} 的排名。我们首先引入一种简单针对 mtm_{t} 的投票操纵策略,专注于涉及 mtm_{t} 的新战斗,通过水印或二元分类器识别它,并仅投票支持 mtm_{t} 获胜。然而,这种策略在实际中效率低下,因为聊天机器人竞技场上有超过 190190 个模型,平均只有约 1%1\% 的新战斗会涉及 mtm_{t}。为克服这一问题,我们提出了普遍操纵策略,利用聊天机器人竞技场的 Elo 评分机制进行投票,即使 mtm_{t} 不直接参与战斗,新的投票也会影响目标模型 mtm_{t} 的排名。我们在约 170170 万条聊天机器人竞技场笔记的历史投票数据上进行实验,表明普遍操纵策略仅通过数百个新的投票即可提高模型排名。虽然我们评估了多个防御机制,但我们的发现凸显了持续防止投票操纵的重要性。我们的代码已在 https://github.com/sail-sg/Rigging-ChatbotArena 提供。

关键词

引用

@article{arxiv.2501.17858,
  title  = {Improving Your Model Ranking on Chatbot Arena by Vote Rigging},
  author = {Rui Min and Tianyu Pang and Chao Du and Qian Liu and Minhao Cheng and Min Lin},
  journal= {arXiv preprint arXiv:2501.17858},
  year   = {2025}
}

备注

ICML 2025