面向离线强化学习的通用黑盒奖劃投毒攻击
机器学习
2024-10-25 v2 人工智能
密码学与安全
摘要
我们研究了针对一般离线强化学习中基于深度神经网络的通用黑盒奖劃投毒攻击问题。我们考虑一种黑盒威胁模型,其中攻击者对学习算法一无所知,其预算受限于约束每个数据点的数据破坏量以及总体扰动。我们要求该攻击对可能被智能体使用的任何高效算法都是通用有效的。我们提出一种名为 `policy contrast attack' 的攻击策略。其思想是找到数据集中表现低和高的策略,使其对智能体分别显现为高和低表现。到目前为止,我们提出了首个在一般离线 RL 设置下的通用黑盒奖劃投毒攻击。我们提供了关于攻击设计的理论见解,并经验性地展示了我们的攻击在不同学习数据集中的当前最先进离线 RL 算法中是高效的。
引用
@article{arxiv.2402.09695,
title = {Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning},
author = {Yinglun Xu and Rohan Gumaste and Gagandeep Singh},
journal= {arXiv preprint arXiv:2402.09695},
year = {2024}
}