规避基于潜在可分性的后门防御
机器学习
2023-03-07 v3 密码学与安全
计算机视觉与模式识别
摘要
近期研究表明,深度学习易受后门投毒攻击。攻击者无需控制训练过程,仅通过修改少量训练数据即可在模型中嵌入隐藏后门以操纵其预测。目前,在多种后门投毒攻击中已广泛观察到一种切实特征——在投毒数据集上训练的模型往往为毒样本与干净样本学到可分离的潜在表示。这种潜在分离极为普遍,以至于一类后门防御直接将其作为默认假设(称为潜在可分性假设),并基于此在潜在空间中通过聚类分析识别毒样本。由此引出一个引人深思的问题:对于后门投毒攻击,潜在分离是否不可避免?该问题对于理解潜在可分性假设是否为防御后门投毒攻击提供了可靠基础至关重要。本文中,我们设计自适应后门投毒攻击,以给出违背该假设的反例。我们的方法包含两个关键组件:(1) 一组被正确标注为其语义类别(而非目标类别)的触发植入样本,可正则化后门学习;(2) 非对称触发植入策略,有助于提升攻击成功率(ASR)并丰富毒样本的潜在表示。在基准数据集上的大量实验验证了我们的自适应攻击在绕过现有基于潜在分离的后门防御方面的有效性。此外,我们的攻击在干净准确率几乎无下降的同时仍保持高攻击成功率。我们的研究呼吁防御设计者在利用潜在分离作为防御假设时保持谨慎。
引用
@article{arxiv.2205.13613,
title = {Circumventing Backdoor Defenses That Are Based on Latent Separability},
author = {Xiangyu Qi and Tinghao Xie and Yiming Li and Saeed Mahloujifar and Prateek Mittal},
journal= {arXiv preprint arXiv:2205.13613},
year = {2023}
}