探索与缓解基于投票的领导者积分板的对抗操纵
机器学习
2025-01-14 v1 密码学与安全
摘要
现在,人类手动投票以评估大型语言模型 (LLM) 的输出已成为常见做法,这与通常通过评估特定任务知识或技能的基准测试形成鲜明对比。Chatbot Arena 是最流行的此类基准测试,通过要求用户在两个随机选取的模型响应中选择更好的一个来排名模型(且不透露哪个模型负责生成)。这些平台广受信赖,被视为 LLM 能力的公平且准确的衡量标准。本文指出,如果未实施机器人防护等防御措施,这些基于投票的基准测试可能容易受到对抗操纵。具体而言,我们展示了攻击者可以在约一千次投票的成本下操纵排行榜(以提升自己喜欢的模型或贬低竞争模型)。我们的攻击包含两个步骤:首先,我们展示了攻击者能够以超过 的准确率确定给定回复所使用的模型;然后,攻击者可利用此信息持续投票(或反投票)针对目标模型。与 Chatbot Arena 开发者合作,我们识别、提出并实施了多项措施,以提高 Chatbot Arena 免受对抗操纵的鲁棒性。根据我们的分析,这些措施显著增加了此类攻击的成本。其中一些防御措施此前已存在,例如机器人防护(Cloudflare)、恶意用户检测和限流。还有一些措施,如 reCAPTCHA 和登录功能,正在被整合以强化 Chatbot Arena 的安全性。
引用
@article{arxiv.2501.07493,
title = {Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards},
author = {Yangsibo Huang and Milad Nasr and Anastasios Angelopoulos and Nicholas Carlini and Wei-Lin Chiang and Christopher A. Choquette-Choo and Daphne Ippolito and Matthew Jagielski and Katherine Lee and Ken Ziyu Liu and Ion Stoica and Florian Tramer and Chiyuan Zhang},
journal= {arXiv preprint arXiv:2501.07493},
year = {2025}
}