利用近似时序信息对强化学习智能体进行黑盒攻击
机器学习
2019-11-25 v2 密码学与安全
计算机视觉与模式识别
机器学习
摘要
近期关于强化学习(RL)的研究表明,训练好的智能体易受恶意构造的对抗样本攻击。本文中,我们展示了此类样本如何从白盒与灰盒攻击推广到强黑盒情形,即攻击者对智能体、其训练参数及训练方法均无所知。我们使用序列到序列(sequence-to-sequence)模型来预测训练好的智能体将采取的单个动作或一系列未来动作。首先,我们表明基于智能体时间序列信息的近似模型,在黑盒设定下对多种游戏与 RL 算法均能持续以高准确率预测 RL 智能体的未来动作。其次,我们发现尽管对抗样本可从目标模型迁移至我们的 RL 智能体,但其表现往往仅以微小优势优于随机高斯噪声。这凸显了以往关于此类智能体工作的严重方法学缺陷:应将随机干扰作为评估基线。第三,我们提出了一种对抗样本在 RL 智能体黑盒攻击中的新用途:它们可被用于在指定时间延迟后触发训练好的智能体做出错误行为。这似乎是一种真正新型的攻击,并可能使攻击者能够将由 RL 智能体控制的设备用作定时炸弹。
引用
@article{arxiv.1909.02918,
title = {Blackbox Attacks on Reinforcement Learning Agents Using Approximated Temporal Information},
author = {Yiren Zhao and Ilia Shumailov and Han Cui and Xitong Gao and Robert Mullins and Ross Anderson},
journal= {arXiv preprint arXiv:1909.02918},
year = {2019}
}