利用多级MMD正则化增强后门攻击
机器学习
2022-03-15 v2
摘要
尽管深度神经网络(DNN)在许多任务上表现出色,其所需的巨大训练资源成为从业者自行开发模型的障碍。从互联网收集数据或雇佣第三方训练模型已变得普遍。遗憾的是,近期研究表明这些操作为向DNN恶意注入隐藏后门提供了可行途径。已有若干防御方法被开发用于检测恶意样本,其共同假设是受感染模型提取的良性与恶意样本的潜表示呈现不同分布。然而,关于分布差异的综合性研究尚缺。本文通过回答三个问题深入探究此类差异:1)分布差异的特征是什么?2)如何有效减小它们?3)这种减小对基于差异的防御方法有何影响?首先,通过引入最大均值差异(MMD)、能量距离(ED)和切片Wasserstein距离(SWD)作为度量,验证了常规训练后门模型上多级表示的分布差异显著。随后,提出ML-MMDR——一种将多级MMD正则化加入损失的差异常减小方法,并在三种典型基于差异的防御方法上证实其有效性。在所有实验设定中,这些方法的F1分数从常规训练后门模型上的90%–100%降至ML-MMDR训练模型上的60%–70%。结果表明所提MMD正则化可增强现有后门攻击方法的隐蔽性。我们的方法原型代码现已发布于https://github.com/xpf/Multi-Level-MMD-Regularization。
引用
@article{arxiv.2111.05077,
title = {Enhancing Backdoor Attacks with Multi-Level MMD Regularization},
author = {Pengfei Xia and Hongjing Niu and Ziqiang Li and Bin Li},
journal= {arXiv preprint arXiv:2111.05077},
year = {2022}
}