通过投票操纵提升聊天机器人竞技场中的模型排名
计算与语言
2025-08-12 v2 人工智能
密码学与安全
机器学习
摘要
聊天机器人竞技场是评估大语言模型的流行平台,通过两两对战让用户投票选择更受欢迎的响应。虽然聊天机器人竞技场被广泛认为是可靠的大语言模型排名榜单,但我们展示了众所周知的投票可以被操纵以提高(或降低)目标模型 的排名。我们首先引入一种简单针对 的投票操纵策略,专注于涉及 的新战斗,通过水印或二元分类器识别它,并仅投票支持 获胜。然而,这种策略在实际中效率低下,因为聊天机器人竞技场上有超过 个模型,平均只有约 的新战斗会涉及 。为克服这一问题,我们提出了普遍操纵策略,利用聊天机器人竞技场的 Elo 评分机制进行投票,即使 不直接参与战斗,新的投票也会影响目标模型 的排名。我们在约 万条聊天机器人竞技场笔记的历史投票数据上进行实验,表明普遍操纵策略仅通过数百个新的投票即可提高模型排名。虽然我们评估了多个防御机制,但我们的发现凸显了持续防止投票操纵的重要性。我们的代码已在 https://github.com/sail-sg/Rigging-ChatbotArena 提供。
引用
@article{arxiv.2501.17858,
title = {Improving Your Model Ranking on Chatbot Arena by Vote Rigging},
author = {Rui Min and Tianyu Pang and Chao Du and Qian Liu and Minhao Cheng and Min Lin},
journal= {arXiv preprint arXiv:2501.17858},
year = {2025}
}
备注
ICML 2025