通过生成式分布建模防御神经后门
机器学习
2019-11-07 v2 机器学习
摘要
神经后门攻击正成为对深度学习的严重安全威胁,而现有防御方法的能力有限,尤其针对复杂后门触发器。在本文中,我们探索由所有可能后门触发器的像素值构成的空间。攻击者用于构建后门模型的原始触发器仅代表该空间中的一个点,它随后会被泛化为一个有效触发器的分布,所有这些触发器都能影响后门模型。因此,先前仅对触发器分布中一个点建模的方法是不够的。获取整个触发器分布(例如通过生成式建模)是有效防御的关键。然而,现有的用于图像生成的生成式建模技术不适用于后门场景,因为触发器分布完全未知。在本文中,我们提出最大熵阶梯近似器(MESA),一种用于高维无采样生成式建模的算法,并用它来恢复触发器分布。我们还开发了一种从后门模型中移除触发器的防御技术。我们在 Cifar10/100 数据集上的实验证明了 MESA 在建模触发器分布方面的有效性以及所提防御方法的鲁棒性。
引用
@article{arxiv.1910.04749,
title = {Defending Neural Backdoors via Generative Distribution Modeling},
author = {Ximing Qiao and Yukun Yang and Hai Li},
journal= {arXiv preprint arXiv:1910.04749},
year = {2019}
}