中文

针对对抗样本的安全微调预训练编码器

计算机视觉与模式识别 2024-03-20 v2

摘要

随着自监督学习的发展,预训练范式已成为深度学习领域的主导解决方案。模型提供者提供的预训练编码器设计为通用的特征提取器,使下游用户能够通过微调最小化工作量即可利用大型模型的优势。然而,近期研究揭示了预训练编码器对下游无关的对抗样本(DAEs)存在脆弱性,这些对抗样本由攻击者精心制作。悬而之问是:在预训练编码器公开可访问且可能被攻击者利用的场景下,如何增强下游模型对DAEs的鲁棒性?本文首先深入探讨了预训练范式中针对对抗样本的现有防御机制。我们的发现表明,当前防御的失败源于预训练数据与下游任务之间的领域漂移,以及编码器参数的敏感性。针对这些挑战,我们提出了一种名为Genetic Evolution-Nurtured Adversarial Fine-tuning(Gen-AF)的两阶段对抗微调方法,旨在增强下游模型的鲁棒性。我们的广泛实验在十种自监督训练方法和六个数据集上进行,结果表明Gen-AF在常规测试准确率和针对最先进DAEs的鲁棒测试准确率方面均取得高水平表现。

关键词

引用

@article{arxiv.2403.10801,
  title  = {Securely Fine-tuning Pre-trained Encoders Against Adversarial Examples},
  author = {Ziqi Zhou and Minghui Li and Wei Liu and Shengshan Hu and Yechao Zhang and Wei Wan and Lulu Xue and Leo Yu Zhang and Dezhong Yao and Hai Jin},
  journal= {arXiv preprint arXiv:2403.10801},
  year   = {2024}
}