中文

面向增强视觉变换器鲁棒性的锐度感知层选择式微调方法

计算机视觉与模式识别 2025-01-06 v1

摘要

视觉变换器(ViTs)已成为高级计算机视觉应用和多模态基础模型中的关键 backbone。尽管具有优势,ViTs 仍对对抗性扰动极其脆弱,这种脆弱性甚至可超过卷积神经网络(CNNs)的脆弱性。此外,ViTs 庞大的参数量和复杂的结构使其尤其容易出现对抗性过拟合,常常损害干净样本和对抗样本的准确性。本文通过一种新颖的、层选择式微调方法来缓解 ViTs 的对抗性过拟合问题:SAFER。我们不对整个模型进行优化,而是识别出最易过拟合的少数几层进行选择性微调,对这些层应用锐度感知最小化,同时冻结模型的其余部分。我们的方法在基线方法上持续提升了干净样本和对抗样本的准确性。典型的改进幅度约为 5%,部分情况可达 20%,适用于各种 ViT 架构和数据集。

关键词

引用

@article{arxiv.2501.01529,
  title  = {SAFER: Sharpness Aware layer-selective Finetuning for Enhanced Robustness in vision transformers},
  author = {Bhavna Gopal and Huanrui Yang and Mark Horton and Yiran Chen},
  journal= {arXiv preprint arXiv:2501.01529},
  year   = {2025}
}