中文

隐形模仿:奖励引导的无环境策略劫持

密码学与安全 2024-05-14 v1 机器学习

摘要

深度强化学习策略是现代控制系统的重要组成部分,代表着宝贵的知识产权。这些策略的开发需要相当大的资源,如领域专业知识、仿真真实性和实际验证。这些策略可能面临模型劫持攻击,这些攻击旨在仅通过黑盒访问就复制其功能。在本文中,我们提出了 Stealthy Imitation,这是首个设计用于在没有环境访问权限或输入范围知识的情况下劫持策略的攻击。这一设置尚未被以前的模型劫持方法所考虑。由于缺乏对受害者输入状态分布的访问,Stealthy Imitation 拟合一个奖励模型以近似它。我们展示,受害者策略在攻击查询分布匹配受害者分布时更难被模仿。我们在多样化的高维控制任务上评估了该方法,始终优于适用于策略劫持的先前数据自由方法。最后,我们提出了一种反击措施,显著削弱了该攻击的效果。

关键词

引用

@article{arxiv.2405.07004,
  title  = {Stealthy Imitation: Reward-guided Environment-free Policy Stealing},
  author = {Zhixiong Zhuang and Maria-Irina Nicolae and Mario Fritz},
  journal= {arXiv preprint arXiv:2405.07004},
  year   = {2024}
}

备注

Accepted at ICML 2024. Project page: https://zhixiongzh.github.io/stealthy-imitation