中文

面向对抗自监督学习的有效定向攻击

机器学习 2023-10-27 v2

摘要

近年来,无监督对抗训练(AT)作为一种在没有任何标签信息的情况下实现模型鲁棒性的手段受到重视。以往无监督 AT 的研究大多聚焦于实现自监督学习(SSL)框架,即通过最大化实例级分类损失来生成对抗样本。然而,我们观察到,使用非定向对抗攻击简单地最大化自监督训练损失,往往会产生无效的对抗样本,可能无助于提升训练模型的鲁棒性,尤其是对于没有负样本的非对比式 SSL 框架。为解决该问题,我们提出了一种用于定向对抗攻击的正样本挖掘方法,以生成适用于对抗 SSL 框架的有效对抗样本。具体而言,我们引入了一种算法,基于熵与相似性为给定实例选择最易混淆却最相似的目标样本,随后将给定实例向所选目标扰动。在基准数据集上,我们的方法应用于非对比式 SSL 框架时表现出鲁棒性的显著提升,应用于对比式 SSL 框架时也有较小但一致的鲁棒性改进。

关键词

引用

@article{arxiv.2210.10482,
  title  = {Effective Targeted Attacks for Adversarial Self-Supervised Learning},
  author = {Minseon Kim and Hyeonjeong Ha and Sooel Son and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2210.10482},
  year   = {2023}
}

备注

NeurIPS 2023