BACKDOORL:针对竞争式强化学习的后门攻击
密码学与安全
2021-12-14 v3 机器学习
摘要
近期研究已证实深度强化学习(RL)系统中后门攻击的可行性。然而,现有攻击要求能够任意修改智能体的观测,将应用范围限制在 Atari 游戏等简单 RL 系统。本文将后门攻击迁移到涉及多智能体的更复杂 RL 系统,并探索在不直接操纵智能体观测的情况下触发后门的可能性。作为概念验证,我们展示了在双人竞争式 RL 系统中,敌手智能体可通过自身动作触发受害智能体的后门。我们在四种竞争环境中对 BACKDOORL 进行原型实现与评估。结果表明,当后门被激活时,受害者的胜率相较未激活时下降 17% 至 37%。
引用
@article{arxiv.2105.00579,
title = {BACKDOORL: Backdoor Attack against Competitive Reinforcement Learning},
author = {Lun Wang and Zaynah Javed and Xian Wu and Wenbo Guo and Xinyu Xing and Dawn Song},
journal= {arXiv preprint arXiv:2105.00579},
year = {2021}
}