通过环境投毒攻击在强化学习中进行策略教导
机器学习
2020-11-24 v1 人工智能
密码学与安全
摘要
我们研究了一种针对强化学习的安全威胁,其中攻击者投毒学习环境以迫使智能体执行由攻击者选择的目标策略。作为受害者,我们考虑其目标是在无限时域问题设置中寻找最大化奖励策略的 RL 智能体。攻击者可在训练时操纵学习环境中的奖励和转移动态,并且有兴趣以隐蔽的方式这样做。我们提出了一种优化框架,用于针对不同攻击代价度量寻找最优隐蔽攻击。我们给出了攻击代价的下界/上界,并在两种设置中实例化我们的攻击:(i)智能体在投毒环境中进行规划的离线设置,以及(ii)智能体利用投毒反馈学习策略的在线设置。我们的结果表明,在温和条件下攻击者可以轻易成功将任何目标策略教导给受害者,并凸显了实践中对强化学习智能体的重大安全威胁。
引用
@article{arxiv.2011.10824,
title = {Policy Teaching in Reinforcement Learning via Environment Poisoning Attacks},
author = {Amin Rakhsha and Goran Radanovic and Rati Devidze and Xiaojin Zhu and Adish Singla},
journal= {arXiv preprint arXiv:2011.10824},
year = {2020}
}
备注
Journal version of ICML'20 paper. New theoretical results for jointly poisoning rewards and transitions