窃取深度强化学习模型以牟利与取乐
机器学习
2020-12-23 v2 机器学习
摘要
本文提出了首个针对深度强化学习(DRL)的模型提取攻击,使外部 adversary 仅通过黑盒 DRL 模型与环境的交互即可精确恢复该模型。针对监督式深度学习模型的模型提取攻击已被广泛研究,但由于 DRL 模型的高复杂性、随机性以及可观测信息的有限性,这些技术无法应用于强化学习场景。我们提出了一种克服上述挑战的新方法。该方法的核心洞见是:DRL 模型提取过程等价于模仿学习——一种成熟的用于学习序列决策策略的方法。基于这一观察,我们的方法首先仅依据目标黑盒 DRL 模型预测的动作构建分类器以揭示其训练算法族,随后利用最先进的模仿学习技术从已识别的算法族中复现该模型。实验结果表明,我们的方法能以高保真度与准确率有效恢复 DRL 模型。我们还展示了两个用例,表明我们的模型提取攻击能够(1)显著提升对抗攻击的成功率,以及(2)即便 DRL 模型受 DNN 水印保护也能隐蔽窃取。这对 DRL 应用的知识产权与隐私保护构成了严重威胁。
引用
@article{arxiv.2006.05032,
title = {Stealing Deep Reinforcement Learning Models for Fun and Profit},
author = {Kangjie Chen and Shangwei Guo and Tianwei Zhang and Xiaofei Xie and Yang Liu},
journal= {arXiv preprint arXiv:2006.05032},
year = {2020}
}