策略模仿的对抗性利用
机器学习
2019-06-05 v1 人工智能
密码学与安全
机器学习
摘要
本文研究一类针对深度强化学习(DRL)策略安全性中机密性方面的攻击。近期研究已确立监督机器学习模型(如分类器)对模型提取攻击的脆弱性。此类攻击利用攻击者可迭代查询模型以获取标签的宽松受限能力,从而能够伪造带标签数据集,用于训练原始模型的复制品。本工作中,我们展示利用模仿学习技术对DRL智能体发起模型提取攻击的可行性。此外,我们开发了利用此类技术的概念验证攻击,用于对DRL策略完整性发起黑盒攻击。我们还讨论了缓解技术的潜在解决方案构想。
引用
@article{arxiv.1906.01121,
title = {Adversarial Exploitation of Policy Imitation},
author = {Vahid Behzadan and William Hsu},
journal= {arXiv preprint arXiv:1906.01121},
year = {2019}
}