中文

学习攻击:针对对抗情境投毒的 bandit 方法

机器学习 2026-03-03 v1 人工智能

摘要

神经情境 bandit 易受到对抗攻击的威胁,攻击者可通过对奖励、动作或情境进行微小扰动来诱导次优决策。我们引入 AdvBandit,这是一种黑盒自适应攻击,将情境投毒建模为连续臂 bandit 问题,使攻击者能够联合学习并利用受害者不断演化的策略。攻击者无需访问受害者的内部参数、奖励函数或梯度信息;相反,它使用从观察到的情境-动作对中通过最大熵逆强化学习模块构建的代理模型,并使用投影梯度下降对该代理进行优化。一个考虑置信上界的高斯过程指导臂的选择。还引入了一种攻击预算控制机制,以限制检测风险和开销。我们提供了理论保证,包括攻击者的亚线性 regret 以及受害者 regret 相对于攻击次数的下界。针对三个真实世界数据集(Yelp、MovieLens 和 Disin)中的各种受害者情境 bandit 进行实验,表明该攻击模型在累积受害者 regret 上优于最先进的基线方法。

关键词

引用

@article{arxiv.2603.00567,
  title  = {Learning to Attack: A Bandit Approach to Adversarial Context Poisoning},
  author = {Ray Telikani and Amir H. Gandomi},
  journal= {arXiv preprint arXiv:2603.00567},
  year   = {2026}
}