强化学习中的奖励投毒:针对未知环境中未知学习器的攻击
机器学习
2021-02-18 v1 人工智能
密码学与安全
摘要
我们研究针对强化学习(RL)的黑盒奖励投毒攻击,其中 adversary 旨在操纵奖励以误导一系列具有未知算法的 RL 智能体,在 adversary 事先未知的环境中学习恶意策略。即,我们的攻击对 adversary 的先验知识做了最小假设:它对环境或学习器均无初始知识,除所执行动作外也不观察学习器的内部机制。我们设计了一种新颖的黑盒攻击 U2,可证明达到与最先进的白盒攻击近乎匹配的性能,证明了即使在最具挑战性的黑盒设定下奖励投毒也是可行的。
引用
@article{arxiv.2102.08492,
title = {Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments},
author = {Amin Rakhsha and Xuezhou Zhang and Xiaojin Zhu and Adish Singla},
journal= {arXiv preprint arXiv:2102.08492},
year = {2021}
}