中文

针对自监督学习的不可见后门攻击

计算机视觉与模式识别 2025-04-04 v2

摘要

自监督学习(SSL)模型容易受到后门攻击。现有的在SSL中有效的后门攻击通常涉及明显的触发器,如彩色补丁或可见噪声,容易被人工检查发现。本文提出了一种针对自监督模型的不可察觉且有效的后门攻击。我们首先发现,现有的为监督学习设计的不可察觉触发器在破坏自监督模型方面效果较差。然后,我们确定这种无效性归因于SSL中后门样本和增强样本分布的重叠。基于这一见解,我们设计了一种攻击,使用与SSL中增强变换解耦的优化触发器,同时保持对人眼不可察觉。在五个数据集和六个SSL算法上的实验表明,我们的攻击高度有效且隐蔽。它还对现有的后门防御具有很强的抵抗力。我们的代码可在https://github.com/Zhang-Henry/INACTIVE找到。

关键词

引用

@article{arxiv.2405.14672,
  title  = {Invisible Backdoor Attack against Self-supervised Learning},
  author = {Hanrong Zhang and Zhenting Wang and Boheng Li and Fulin Lin and Tingxu Han and Mingyu Jin and Chenlu Zhan and Mengnan Du and Hongwei Wang and Shiqing Ma},
  journal= {arXiv preprint arXiv:2405.14672},
  year   = {2025}
}