FLARE:利用通用对抗掩码对深度强化学习智能体进行指纹识别
机器学习
2023-09-26 v3 密码学与安全
摘要
我们提出了 FLARE,这是首个用于验证某个疑似深度强化学习(DRL)策略是否为另一(受害)策略的非法副本的指纹识别机制。我们首先表明,可以找到不可迁移的通用对抗掩码(即扰动),以生成能够从受害策略成功迁移到其修改版本、但不能迁移到独立训练策略的对抗样本。FLARE 将这些掩码用作指纹,通过测量此类掩码扰动状态下动作一致值来验证被盗 DRL 策略的真实所有权。我们的实证评估表明,FLARE 是有效的(在被盗副本上达到 100% 动作一致),且不会误判独立策略(无误报)。FLARE 对模型修改攻击也具有鲁棒性,且更知情的对手难以在不损害智能体性能的情况下轻易规避。我们还表明,并非所有通用对抗掩码都适合作为指纹,这源于 DRL 策略的固有特性。DRL 问题的时空动态与序列决策过程使得刻画 DRL 策略的决策边界更为困难,也难以搜索捕捉其几何结构的通用掩码。
引用
@article{arxiv.2307.14751,
title = {FLARE: Fingerprinting Deep Reinforcement Learning Agents using Universal Adversarial Masks},
author = {Buse G. A. Tekgul and N. Asokan},
journal= {arXiv preprint arXiv:2307.14751},
year = {2023}
}
备注
Will appear in the proceedings of ACSAC 2023; 14 pages, 6 figures, 8 tables