高维离线 bandits 的高效对抗攻击
机器学习
2026-02-03 v1 人工智能
摘要
bandit 算法近期成为评估机器学习模型的强大工具,包括生成式图像模型和大语言模型,通过高效识别优质候选方案而无需穷尽比较。这些方法通常依赖奖励模型(常在 Hugging Face 等平台提供公开权重)以提供反馈。虽然在线评估昂贵且需重复试验,但基于日志数据的离线评估日益受到青睐。然而,离线 bandit 评估的对抗鲁棒性尚未得到充分探讨,尤其是当攻击者在 bandit 训练前扰动奖励模型(而非训练数据)时。本文通过理论与实证研究,填补这一空白,考察离线 bandit 训练对奖励模型对抗操纵的脆弱性。我们提出一种新威胁模型,攻击者利用高维离线数据劫持 bandit 行为。从线性奖励函数出发,扩展至 ReLU 神经网络等非线性模型,我们研究了针对两种 Hugging Face 评估器的攻击:一种衡量审美质量,另一种评估构图对齐性。结果表明,即使对奖励模型权重进行微小、不可感知的扰动,也能极大改变 bandit 的行为。从理论角度,我们证明了一个显著的高维效应:随输入维度增加,成功攻击所需的扰动范数降低,使得图像评估等现代应用尤其脆弱。大量实验表明,简单随机扰动无效,而精心定位的扰动可实现近乎完美的攻击成功率。
关键词
引用
@article{arxiv.2602.01658,
title = {Efficient Adversarial Attacks on High-dimensional Offline Bandits},
author = {Seyed Mohammad Hadi Hosseini and Amir Najafi and Mahdieh Soleymani Baghshah},
journal= {arXiv preprint arXiv:2602.01658},
year = {2026}
}
备注
Accepted at ICLR 2026 Conference