中文

AGFT: 对齐引导微调,用于视觉-语言模型的零样本对抗鲁棒性

计算机视觉与模式识别 2026-04-01 v1 人工智能 机器学习

摘要

预训练的视觉-语言模型(VLMs)展现出强大的零样本泛化能力,但仍然容易受到对抗扰动的影响。现有的分类引导对抗微调方法往往会破坏预训练的跨模态对齐,削弱视觉-文本对应关系并降低零样本性能。在本文中,我们提出了一种对齐引导微调(AGFT)框架,在保持跨模态语义结构的同时增强零样本对抗鲁棒性。与依赖硬标签且无法维持图像与文本之间相对关系的基于标签的方法不同,AGFT 利用原始模型的概率预测进行文本引导对抗训练,通过软对齐分布将对抗视觉特征与文本嵌入对齐,从而提升零样本对抗鲁棒性。为了解决微调引入的结构差异,我们引入了一种分布一致性校准机制,将鲁棒模型的输出调整为预训练模型预测的温度缩放版本以匹配之。在多个零样本基准上的大量实验表明,AGFT 优于最先进的方法,同时显著提升了零样本对抗鲁棒性。

关键词

引用

@article{arxiv.2603.29410,
  title  = {AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models},
  author = {Yubo Cui and Xianchao Guan and Zijun Xiong and Zheng Zhang},
  journal= {arXiv preprint arXiv:2603.29410},
  year   = {2026}
}

备注

Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}