面向视觉语言模型的少样本对抗低秩微调
机器学习
2025-09-29 v3
摘要
视觉语言模型(VLMs)如 CLIP 通过大规模对比预训练在跨模态任务中展现出惊人的性能。为了高效地适应下游任务,参数高效微调(PEFT)技术如(低秩适应)LoRA 已成为少样本场景中全面微调的可扩展替代方案。然而,像传统深度神经网络一样,VLMs 对对抗攻击极其脆弱,微小的不可感知扰动即可显著降低模型性能。对抗训练是提高 PEFT 模型鲁棒性的最有效策略。本文提出 AdvCLIP-LoRA,据我们所知是首个旨在增强使用 LoRA 在少样本设置下微调的 CLIP 模型对抗鲁棒性的方法。我们将训练建模为低秩适配器和对抗扰动之间的 minimax 优化,实现小训练参数下的稳健适应。跨越八个数据集和两个 backbone(ViT-B/16 和 ViT-B/32),AdvCLIP-LoRA 在少样本分类、对抗 base-to-new 泛化和跨数据集迁移方面实现了最先进的性能,在不显著牺牲干净准确性的前提下,实现了更高的对抗鲁棒性。这些发现突显了 AdvCLIP-LoRA 作为资源受限环境下 VLMs 稳健适应的实用方法。
引用
@article{arxiv.2505.15130,
title = {Few-Shot Adversarial Low-Rank Fine-Tuning of Vision-Language Models},
author = {Sajjad Ghiasvand and Haniyeh Ehsani Oskouie and Mahnoosh Alizadeh and Ramtin Pedarsani},
journal= {arXiv preprint arXiv:2505.15130},
year = {2025}
}