将偏见转化为错误:基于多臂盒子的 LLM 判官风格操纵攻击
密码学与安全
2026-05-29 v2 人工智能
机器学习
摘要
LLM 判官已知的风格偏见,如对冗长或特定句子结构的偏好,构成一个未被充分探索的安全漏洞。本工作引入 BITE(BIas exploraTion and Exploitation),一个黑盒对抗框架,通过保持语义不变的方式学习风格编辑,以误导 LLM 判官并人为提升其赋予的分数。我们将风格编辑的选择问题刻画为情境多臂盒子问题,并使用 LinUCB 策略自适应选择能够最大化判官分数的编辑,无需获取模型参数或梯度。我们在广泛的 LLM 判官和任务上进行实验,包括聊天机器人评选板和 AI 评论员基准的 pointwise 和 pairwise 比较。BITE 实现了超过 65% 的攻击成功率,并在 9 分尺度上提升 1-2 分,同时保持语义等价。我们进一步评估了攻击的隐身性,表明 BITE 可规避标准风格控制方法和多个检测基线。我们的发现揭示了 LLM-作为-判官范式的根本弱点,动机发展出鲁棒且具攻击感知能力的评估机制。我们的代码已公开:https://github.com/xianglinyang/llm-as-a-judge-attack。
引用
@article{arxiv.2605.26156,
title = {Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges},
author = {Xianglin Yang and Bryan Hooi and Gelei Deng and Tianwei Zhang and Jin Song Dong},
journal= {arXiv preprint arXiv:2605.26156},
year = {2026}
}
备注
Accepted to the Forty-Third International Conference on Machine Learning (ICML 2026)