中文

针对连续强化学习的可证明高效动作操纵攻击

机器学习 2024-11-21 v1 人工智能

摘要

操纵智能体与环境之间的交互轨迹可以控制智能体的训练与行为,暴露了强化学习(RL)的潜在漏洞。例如,在由 RL 控制的 Cyber-Physical Systems(CPS)中,攻击者可以在训练阶段将所采用 RL 的动作操纵为其他动作,这将导致不良后果。现有工作研究了表格设定下的动作操纵攻击,其中状态和动作是离散的。正如在许多新兴的 RL 应用(如自动驾驶)中所见,连续动作空间被广泛接受,然而其动作操纵攻击尚未得到充分研究。本文在白盒和黑盒两种场景下考虑了这一关键问题。具体而言,利用仅从轨迹中获取的知识,我们提出了一种名为 LCBT 的黑盒攻击算法,该算法使用 Monte Carlo 树搜索方法进行高效的动作搜索与操纵。此外,我们证明了对于动态遗憾与总步数呈次线性关系的智能体,LCBT 仅需次线性攻击成本即可引导智能体收敛至目标策略,即 O(R(T)+MH3KElog(MT))(0<E<1)O\left(\mathcal{R}(T) + MH^3K^E\log (MT)\right)(0<E<1),其中 HH 为每个 episode 的步数,KK 为 episode 总数,T=KHT=KH 为总步数,MM 为状态空间划分的子空间数,R(T)\mathcal{R}(T) 为 RL 算法遗憾的界。我们在连续设定下的三种激进算法 DDPG、PPO 和 TD3 上实施了所提出的攻击方法,结果显示出良好的攻击性能。

关键词

引用

@article{arxiv.2411.13116,
  title  = {Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning},
  author = {Zhi Luo and Xiyuan Yang and Pan Zhou and Di Wang},
  journal= {arXiv preprint arXiv:2411.13116},
  year   = {2024}
}