中文

双智能体强化学习中的隐式投毒攻击:面向训练期攻击的对抗策略

机器学习 2023-02-28 v1 人工智能 密码学与安全 多智能体系统

摘要

在定向投毒攻击中,攻击者操纵智能体与环境的交互,迫使该智能体采用其感兴趣的称为目标策略的策略。已有工作主要集中于修改标准 MDP 基本要素(如奖励或状态转移)的攻击。本文研究双智能体设定下的定向投毒攻击,其中攻击者通过修改某一智能体同伴的策略,隐式地毒化该智能体的有效环境。我们构建了一个用于设计最优攻击的优化框架,其中攻击代价度量解偏离同伴智能体假定默认策略的程度。我们进一步研究了该优化框架的计算性质。聚焦于表格设定,我们表明,与基于 MDP 基本要素(转移与(无界)奖励)且始终可行的投毒攻击不同,判定隐式投毒攻击的可行性是 NP 难的。我们给出了刻画结果,确立了攻击问题可行的充分条件,以及攻击最优代价的上下界。我们提出了两种寻找最优对抗策略的算法途径:一种基于表格策略的模型方法,以及一种基于参数化/神经网络策略的无模型方法。我们通过实验展示了所提算法的有效性。

关键词

引用

@article{arxiv.2302.13851,
  title  = {Implicit Poisoning Attacks in Two-Agent Reinforcement Learning: Adversarial Policies for Training-Time Attacks},
  author = {Mohammad Mohammadi and Jonathan Nöther and Debmalya Mandal and Adish Singla and Goran Radanovic},
  journal= {arXiv preprint arXiv:2302.13851},
  year   = {2023}
}