RAEDiff:基于去噪扩散概率模型的可逆对抗样本自生成与自恢复
密码学与安全
2023-11-23 v1 人工智能
图形学
机器学习
摘要
通过大量努力收集并标注的数据集可有效用于训练深度神经网络(DNN)模型。然而,这些数据集易被未授权用户滥用,导致数据集创建者拥有的知识产权(IP)受到侵犯。可逆对抗样本(RAE)有助于解决数据集的IP保护问题。RAE是可被恢复至原始状态的对抗扰动图像。作为一种前沿方法,RAE方案既能防止未授权用户进行恶意模型训练,又能保障授权用户的合法使用。然而,在现有工作中,RAE仍依赖嵌入的辅助信息来实现恢复,这可能会削弱其对抗能力。本文提出一种名为RAEDiff的新型自生成与自恢复方法,基于去噪扩散概率模型(DDPM)生成RAE。该方法将数据集扩散至偏置高斯分布(BGD),并利用DDPM的先验知识来生成和恢复RAE。实验结果表明,RAEDiff能为包括人工智能生成内容(AIGC)模型在内的DNN模型有效自生成对抗扰动,同时展现出显著的自恢复能力。
引用
@article{arxiv.2311.12858,
title = {RAEDiff: Denoising Diffusion Probabilistic Models Based Reversible Adversarial Examples Self-Generation and Self-Recovery},
author = {Fan Xing and Xiaoyi Zhou and Xuefeng Fan and Zhuo Tian and Yan Zhao},
journal= {arXiv preprint arXiv:2311.12858},
year = {2023}
}