通过聚类激活掩码消除自监督学习后门
计算机视觉与模式识别
2024-11-04 v2 人工智能
密码学与安全
机器学习
摘要
自监督学习(Self-Supervised Learning, SSL)是从文本、图像和视频等无标签数据中学习表示的有效范式。然而,研究人员近期发现 SSL 容易受到后门攻击。攻击者可通过在训练数据集中植入少量中毒样本嵌入隐藏的 SSL 后门,并恶意操纵下游模型的行为。为防御 SSL 后门攻击,一种可行的途径是检测并移除训练集中的有毒样本。然而,现有的 SSL 后门防御方法无法精确检测有毒样本。本文提出通过聚类激活掩码消除 SSL 后门,并提出一种新颖的 PoisonCAM 方法。在获得基于中毒数据集训练的威胁模型后,该方法基于掩码后门触发器可有效改变下游聚类模型激活的假设,能够精确检测有毒样本。在实验中,与最先进方法在中毒 ImageNet-100 上 3% 的准确率相比,我们的 PoisonCAM 在后门触发器检测上达到了 96% 的准确率。此外,与最先进方法相比,我们提出的 PoisonCAM 显著提升了受后门攻击时训练的 SSL 模型的性能。本文一经接受,我们将开放代码、数据和训练好的模型。
引用
@article{arxiv.2312.07955,
title = {Erasing Self-Supervised Learning Backdoor by Cluster Activation Masking},
author = {Shengsheng Qian and Dizhan Xue and Yifei Wang and Shengjie Zhang and Huaiwen Zhang and Changsheng Xu},
journal= {arXiv preprint arXiv:2312.07955},
year = {2024}
}