中文

自监督学习中的后门攻击

计算机视觉与模式识别 2022-06-10 v3

摘要

大规模无标签数据推动了近期自监督学习方法的学习进展,这些方法能学习丰富的视觉表示。最先进的从图像学习表示的自监督方法(如MoCo、BYOL、MSF)使用了一种归纳偏置,即图像的随机增强(如随机裁剪)应产生相似的嵌入。我们表明此类方法易受后门攻击——攻击者通过向图像添加触发器(由攻击者选定的图像块)来毒化一小部分无标签数据。模型在干净测试图像上表现良好,但攻击者可通过在测试时展示触发器来操纵模型的决策。后门攻击在监督学习中已被广泛研究,据我们所知,我们是首个在自监督学习中研究它们的工作。后门攻击在自监督学习中更为现实,因为大规模无标签数据的使用使得通过数据审查来移除毒化数据难以实现。我们展示在我们的定向攻击中,攻击者可通过在测试时使用触发器为目标类别产生大量假阳性。我们还提出了一种基于知识蒸馏的防御方法,成功中和了该攻击。我们的代码可在此获取:https://github.com/UMBCvision/SSL-Backdoor 。

关键词

引用

@article{arxiv.2105.10123,
  title  = {Backdoor Attacks on Self-Supervised Learning},
  author = {Aniruddha Saha and Ajinkya Tejankar and Soroush Abbasi Koohpayegani and Hamed Pirsiavash},
  journal= {arXiv preprint arXiv:2105.10123},
  year   = {2022}
}

备注

CVPR 2022 (Oral)