FullLoRA:高效提升预训练视觉Transformer的鲁棒性
计算机视觉与模式识别
2025-06-24 v2
摘要
近年来,视觉Transformer(ViT)模型已逐渐成为各类计算机视觉任务的主流,模型的鲁棒性也受到越来越多的关注。然而,现有的大型模型在训练时往往优先考虑性能,可能忽略了鲁棒性,从而导致严重的安全隐患。本文中,我们确立了一项新挑战:探索如何使用少量额外参数进行对抗微调,以快速有效地增强标准训练模型的对抗鲁棒性。为应对这一挑战,我们开发了新颖的 LNLoRA 模块,在传统 LoRA 模块之前引入一个可学习的层归一化,有助于缓解对抗训练范式与标准训练范式之间参数的幅度差异。此外,我们提出了 FullLoRA 框架,将可学习的 LNLoRA 模块集成到基于 ViT 模型的所有关键组件中,同时保持预训练模型冻结,从而通过参数高效的对抗微调方式显著提升模型鲁棒性。在多个数据集上的大量实验证明了我们提出的 FullLoRA 框架的优越性。它实现了与全微调相当的鲁棒性,而仅需约 5% 的可学习参数。这也有效解决了因对抗微调带来的额外模型存储空间和巨大训练时间的顾虑。
引用
@article{arxiv.2401.01752,
title = {FullLoRA: Efficiently Boosting the Robustness of Pretrained Vision Transformers},
author = {Zheng Yuan and Jie Zhang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2401.01752},
year = {2025}
}
备注
Accepted by IEEE Transactions on Image Processing (TIP). 11 pages, 3 figures, 8 tables