去中心化强化学习中的协作后门攻击及其理论保证
机器学习
2024-05-27 v1 人工智能
摘要
去中心化强化学习(RL)的安全性是一个具有挑战性的问题,因为恶意智能体可以与良性智能体共享其被污染的策略。本文针对去中心化强化学习场景中的协作后门攻击进行了研究。不同于现有方法将整个后门攻击隐藏在共享策略背后,本方法根据RL的状态空间将后门行为分解为多个组件。每个恶意智能体在其策略中隐藏一个组件并与良性智能体共享其策略。当良性智能体学习所有被污染的策略时,后门攻击即在其策略中被组装。给出理论证明,表明我们的协作方法能够成功地将后门注入到良性智能体的策略中。与现有后门攻击相比,本方法更为隐蔽,因为每个攻击者的策略仅包含后门攻击的一个组件,难以被检测。基于Atari环境进行大量仿真实验,展示了本方法的有效性与隐蔽性。据我们所知,这是首个在去中心化强化学习中提出可证明协作后门攻击的论文。
引用
@article{arxiv.2405.15245,
title = {Cooperative Backdoor Attack in Decentralized Reinforcement Learning with Theoretical Guarantee},
author = {Mengtong Gao and Yifei Zou and Zuyuan Zhang and Xiuzhen Cheng and Dongxiao Yu},
journal= {arXiv preprint arXiv:2405.15245},
year = {2024}
}