中文

批量强化学习与控制中的策略投毒

机器学习 2019-11-01 v2 机器学习

摘要

我们研究一种针对批量强化学习与控制的安全威胁,其中攻击者旨在投毒所学得的策略。受害者是一个强化学习器/控制器,它首先从批量数据集估计动态与奖励,然后相对于估计值求解最优策略。攻击者可在学习发生前轻微修改数据集,并希望迫使学习器学到由攻击者选定的目标策略。我们提出一个解决批量策略投毒攻击的统一框架,并在两类标准受害者上实例化该攻击:强化学习中的表格确定等价学习器与控制中的线性二次调节器。我们展示两种实例化均导致一个凸优化问题,其全局最优性得到保证,并提供关于攻击可行性与攻击代价的分析。实验显示了策略投毒攻击的有效性。

关键词

引用

@article{arxiv.1910.05821,
  title  = {Policy Poisoning in Batch Reinforcement Learning and Control},
  author = {Yuzhe Ma and Xuezhou Zhang and Wen Sun and Xiaojin Zhu},
  journal= {arXiv preprint arXiv:1910.05821},
  year   = {2019}
}

备注

NeurIPS 2019