中文

策略模仿的对抗性利用

机器学习 2019-06-05 v1 人工智能 密码学与安全 机器学习

摘要

本文研究一类针对深度强化学习(DRL)策略安全性中机密性方面的攻击。近期研究已确立监督机器学习模型(如分类器)对模型提取攻击的脆弱性。此类攻击利用攻击者可迭代查询模型以获取标签的宽松受限能力,从而能够伪造带标签数据集,用于训练原始模型的复制品。本工作中,我们展示利用模仿学习技术对DRL智能体发起模型提取攻击的可行性。此外,我们开发了利用此类技术的概念验证攻击,用于对DRL策略完整性发起黑盒攻击。我们还讨论了缓解技术的潜在解决方案构想。

关键词

引用

@article{arxiv.1906.01121,
  title  = {Adversarial Exploitation of Policy Imitation},
  author = {Vahid Behzadan and William Hsu},
  journal= {arXiv preprint arXiv:1906.01121},
  year   = {2019}
}