中文

强化学习中的奖励投毒:针对未知环境中未知学习器的攻击

机器学习 2021-02-18 v1 人工智能 密码学与安全

摘要

我们研究针对强化学习(RL)的黑盒奖励投毒攻击,其中 adversary 旨在操纵奖励以误导一系列具有未知算法的 RL 智能体,在 adversary 事先未知的环境中学习恶意策略。即,我们的攻击对 adversary 的先验知识做了最小假设:它对环境或学习器均无初始知识,除所执行动作外也不观察学习器的内部机制。我们设计了一种新颖的黑盒攻击 U2,可证明达到与最先进的白盒攻击近乎匹配的性能,证明了即使在最具挑战性的黑盒设定下奖励投毒也是可行的。

关键词

引用

@article{arxiv.2102.08492,
  title  = {Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments},
  author = {Amin Rakhsha and Xuezhou Zhang and Xiaojin Zhu and Adish Singla},
  journal= {arXiv preprint arXiv:2102.08492},
  year   = {2021}
}