一种针对自监督学习的极其简单的后门攻击
密码学与安全
2023-08-15 v2 计算机视觉与模式识别
机器学习
摘要
作为一种机器学习新范式,自监督学习(SSL)能够在不依赖标签的情况下学习复杂数据的高质量表示。除了消除对标注数据的需求外,研究发现 SSL 相比监督学习提升了对抗鲁棒性,因为缺乏标签使得 adversary 更难操纵模型预测。然而,这种鲁棒性优势在多大程度上推广到其他类型的攻击仍是一个开放问题。我们在后门攻击的背景下探讨该问题。具体而言,我们设计并评估了 CTRL,一种极其简单却高度有效的自监督后门攻击。仅通过用难以区分的投毒样本污染极小部分训练数据(≤1%),CTRL 就能使任何嵌入触发器的输入在推理时被以高概率(≥99%)误分类到 adversary 指定的类别。我们的发现表明 SSL 与监督学习对后门攻击的脆弱性相当。更重要的是,借助 CTRL 我们研究了 SSL 对后门攻击的固有漏洞。通过经验与分析证据,我们揭示 SSL 有益于对抗鲁棒性的表示不变性性质,可能也正是使 SSL 极易受后门攻击的原因。我们的发现还意味着,现有针对监督后门攻击的防御不易改造以适应 SSL 的独特漏洞。
引用
@article{arxiv.2210.07346,
title = {An Embarrassingly Simple Backdoor Attack on Self-supervised Learning},
author = {Changjiang Li and Ren Pang and Zhaohan Xi and Tianyu Du and Shouling Ji and Yuan Yao and Ting Wang},
journal= {arXiv preprint arXiv:2210.07346},
year = {2023}
}
备注
The 2023 International Conference on Computer Vision (ICCV '23)