批量强化学习与控制中的策略投毒
机器学习
2019-11-01 v2 机器学习
摘要
我们研究一种针对批量强化学习与控制的安全威胁,其中攻击者旨在投毒所学得的策略。受害者是一个强化学习器/控制器,它首先从批量数据集估计动态与奖励,然后相对于估计值求解最优策略。攻击者可在学习发生前轻微修改数据集,并希望迫使学习器学到由攻击者选定的目标策略。我们提出一个解决批量策略投毒攻击的统一框架,并在两类标准受害者上实例化该攻击:强化学习中的表格确定等价学习器与控制中的线性二次调节器。我们展示两种实例化均导致一个凸优化问题,其全局最优性得到保证,并提供关于攻击可行性与攻击代价的分析。实验显示了策略投毒攻击的有效性。
引用
@article{arxiv.1910.05821,
title = {Policy Poisoning in Batch Reinforcement Learning and Control},
author = {Yuzhe Ma and Xuezhou Zhang and Wen Sun and Xiaojin Zhu},
journal= {arXiv preprint arXiv:1910.05821},
year = {2019}
}
备注
NeurIPS 2019