中文

预训练模型引导的零样本对抗鲁棒性微调

计算机视觉与模式识别 2024-04-11 v3

摘要

像CLIP这样的大规模预训练视觉-语言模型在各种任务上展示了令人印象深刻的性能,并表现出显著的零样本泛化能力,但它们也容易受到难以察觉的对抗样本的攻击。现有工作通常采用对抗训练(微调)作为对抗样本的防御方法。然而,直接应用于CLIP模型可能导致过拟合,损害模型的泛化能力。在本文中,我们提出了预训练模型引导的对抗微调(PMG-AFT)方法,该方法通过精心设计一个辅助分支,利用来自原始预训练模型的监督,以增强模型的零样本对抗鲁棒性。具体来说,PMG-AFT最小化目标模型中对抗样本的特征与预训练模型中特征之间的距离,旨在保留预训练模型已经捕获的泛化特征。在15个零样本数据集上的大量实验表明,PMG-AFT显著优于最先进的方法,将top-1鲁棒准确率平均提高了4.99%。此外,我们的方法将干净准确率平均提高了8.72%。我们的代码可在https://github.com/serendipity1122/Pre-trained-Model-Guided-Fine-Tuning-for-Zero-Shot-Adversarial-Robustness获取。

关键词

引用

@article{arxiv.2401.04350,
  title  = {Pre-trained Model Guided Fine-Tuning for Zero-Shot Adversarial Robustness},
  author = {Sibo Wang and Jie Zhang and Zheng Yuan and Shiguang Shan},
  journal= {arXiv preprint arXiv:2401.04350},
  year   = {2024}
}

备注

Accepted by CVPR 2024