通过解混杂表示学习进行后门防御
人工智能
2023-03-14 v1 密码学与安全
机器学习
摘要
深度神经网络(DNNs)近期被表明易受后门攻击,攻击者在训练数据集中注入少量中毒样本,从而在 DNN 模型中嵌入隐藏后门。尽管已有大量工作致力于检测并移除后门模型中的后门,但是否能直接从中毒数据集获得无后门的干净模型仍不明确。本文中,我们首先构建因果图对中毒数据的生成过程建模,发现后门攻击充当混杂因子,带来输入图像与目标标签之间的虚假关联,使模型预测可靠性下降。受该因果理解的启发,我们提出因果启发的后门防御(CBD),以学习解混杂表示用于可靠分类。具体而言,有意训练一个后门模型以捕获混杂效应;另一个干净模型则通过最小化与后门模型混杂表示之间的互信息并采用样本级重加权方案,致力于捕获所需的因果效应。在多个基准数据集上针对 6 种最先进攻击的大量实验验证了我们所提防御方法在降低后门威胁的同时保持对良性样本的高预测准确性方面有效。进一步分析表明 CBD 也能抵御潜在的适应性攻击。代码见 \url{https://github.com/zaixizhang/CBD}。
引用
@article{arxiv.2303.06818,
title = {Backdoor Defense via Deconfounded Representation Learning},
author = {Zaixi Zhang and Qi Liu and Zhicai Wang and Zepu Lu and Qingyong Hu},
journal= {arXiv preprint arXiv:2303.06818},
year = {2023}
}
备注
Accepted by CVPR 2023