BadRL:针对强化学习的稀疏目标后门攻击
机器学习
2023-12-21 v1 人工智能
密码学与安全
摘要
强化学习(RL)中的后门攻击先前采用了密集的攻击策略以确保攻击成功。然而,这些方法存在攻击成本高和可检测性增加的问题。在这项工作中,我们提出了一种新方法BadRL,其重点是在训练和测试期间进行高度稀疏的后门投毒,同时保持攻击成功。我们的算法BadRL策略性地选择具有高攻击价值的状态观测来在训练和测试期间注入触发器,从而降低被检测到的机会。与先前使用样本无关触发器模式的方法相反,BadRL基于目标状态观测动态生成不同的触发器模式,从而增强了其有效性。理论分析表明,在特定假设下,目标后门攻击总是可行的并且保持隐蔽。在各种经典RL任务上的实证结果表明,BadRL可以在训练期间以极少的投毒努力(总训练步数的0.003%)和测试期间不频繁的攻击,显著降低受害智能体的性能。
引用
@article{arxiv.2312.12585,
title = {BadRL: Sparse Targeted Backdoor Attack Against Reinforcement Learning},
author = {Jing Cui and Yufei Han and Yuzhe Ma and Jianbin Jiao and Junge Zhang},
journal= {arXiv preprint arXiv:2312.12585},
year = {2023}
}
备注
Extended version of the submission accepted by AAAI 2024. It is revised by integrating review comments