对强化学习策略的最优攻击
机器学习
2019-08-02 v1 密码学与安全
机器学习
摘要
使用深度强化学习训练得到的控制策略,近来被证明易受到对抗攻击,即便对策略输入引入极小的扰动亦然。迄今提出的攻击多基于启发式方法设计,并借用了监督学习中用于欺骗分类器的既有对抗样本构造技术。相反,本文研究依据明确定义攻击者目标(例如最小化主智能体平均奖励)来设计最优攻击的问题。当攻击者已知策略、系统动态以及奖励(称为白盒攻击场景)时,设计最优攻击等价于求解一个马尔可夫决策过程。对于我们所谓的黑盒攻击(既不知策略也不知系统),最优攻击可使用强化学习技术训练得到。通过数值实验,我们证明了相比现有攻击(通常基于梯度方法)我们的攻击更高效。我们进一步量化了攻击的潜在影响,并建立其与受攻击策略平滑度之间的联系。平滑策略天然更不易受攻击(这解释了为何关于状态满足 Lipschitz 条件的策略更具韧性)。最后,我们表明从主智能体视角看,系统不确定性与攻击者可被建模为部分可观测马尔可夫决策过程。我们实际证明,采用适用于 POMDP 的强化学习技术(例如使用循环神经网络)可得到更具韧性的策略。
引用
@article{arxiv.1907.13548,
title = {Optimal Attacks on Reinforcement Learning Policies},
author = {Alessio Russo and Alexandre Proutiere},
journal= {arXiv preprint arXiv:1907.13548},
year = {2019}
}