用于深度强化学习策略水印的顺序触发器
机器学习
2019-06-05 v1 人工智能
密码学与安全
机器学习
摘要
本文提出了一种用于深度强化学习(DRL)策略水印的新方案。该方案提供了一种机制,以策略对指定状态转移序列的响应形式,在策略中嵌入唯一标识符,同时对策略的名义性能影响最小。该水印方案的应用包括检测专有策略的未授权复制,以及使授权实体能够优雅地中断或终止 DRL 活动。我们通过在 Cartpole 环境中对训练的 DQN 策略进行水印实验评估,证明了我们方案的可行性。
引用
@article{arxiv.1906.01126,
title = {Sequential Triggers for Watermarking of Deep Reinforcement Learning Policies},
author = {Vahid Behzadan and William Hsu},
journal= {arXiv preprint arXiv:1906.01126},
year = {2019}
}