中文

用于深度强化学习策略水印的顺序触发器

机器学习 2019-06-05 v1 人工智能 密码学与安全 机器学习

摘要

本文提出了一种用于深度强化学习(DRL)策略水印的新方案。该方案提供了一种机制,以策略对指定状态转移序列的响应形式,在策略中嵌入唯一标识符,同时对策略的名义性能影响最小。该水印方案的应用包括检测专有策略的未授权复制,以及使授权实体能够优雅地中断或终止 DRL 活动。我们通过在 Cartpole 环境中对训练的 DQN 策略进行水印实验评估,证明了我们方案的可行性。

关键词

引用

@article{arxiv.1906.01126,
  title  = {Sequential Triggers for Watermarking of Deep Reinforcement Learning Policies},
  author = {Vahid Behzadan and William Hsu},
  journal= {arXiv preprint arXiv:1906.01126},
  year   = {2019}
}