中文

ESTAS:利用单个目标无标签样本在自监督编码器中实现有效且稳定的木马攻击

计算机视觉与模式识别 2023-01-25 v2 密码学与安全 机器学习

摘要

新兴的自监督学习(SSL)已成为一种流行的图像表示编码方法,可避免对标注数据的依赖,并从大规模、普遍存在的无标签数据中学习丰富表示。随后,人们可以在预训练的 SSL 图像编码器之上,利用极少或无需标注的下游数据训练一个下游分类器。尽管大量工作表明 SSL 在不同下游任务上取得了卓越且具竞争力的性能,但其安全问题(例如 SSL 编码器中的木马攻击)仍未被充分研究。本文中,我们提出一种新颖的木马攻击方法,记为 ESTAS,它仅利用一个目标无标签样本即可在 SSL 编码器中实现有效且稳定的攻击。具体而言,我们在 ESTAS 中提出一致触发器投毒与级联优化,以提升攻击效能与模型精度,并省去了从大规模无序无标签数据中提取昂贵的目标类数据样本的过程。我们在多个数据集上的大量实验表明,ESTAS 利用一个目标类样本稳定地实现了 > 99% 的攻击成功率(ASR)。与先前工作相比,ESTAS 平均实现了 > 30% 的 ASR 提升与 > 8.3% 的精度改进。

关键词

引用

@article{arxiv.2211.10908,
  title  = {ESTAS: Effective and Stable Trojan Attacks in Self-supervised Encoders with One Target Unlabelled Sample},
  author = {Jiaqi Xue and Qian Lou},
  journal= {arXiv preprint arXiv:2211.10908},
  year   = {2023}
}

备注

10 pages, 7 figures, 6 tables