中文

迈向细粒度鲁棒性:视觉-语言模型的注意力引导测试时提示微调

计算机视觉与模式识别 2026-05-20 v1

摘要

视觉-语言模型 (VLM),例如 CLIP,通过各种微调适应方法在下游任务上取得了显著的零样本性能。然而,最近的研究证明,对抗性攻击可以显著降低 VLM 的推理能力,对其实际应用构成重大风险。主流的测试时适应方法通常依赖多视图增强来实现各种微调策略,这些方法难以识别语义信息,并且在细粒度场景中容易破坏判别性区域。为了解决这些局限性,我们提出了注意力引导测试时提示微调 (A-TPT),这是一种为测试时适应而设计的语义保持方法。我们首先优化了梯度注意力传播机制,以识别在对抗性攻击下幸存的有语义意义的区域。此外,我们利用它们来引导空间变化的增强强度和多视图集成,以进行提示微调和推理。大量实验表明,A-TPT 在对抗性和干净数据上都优于现有的测试时适应方法。代码可在 https://github.com/SEU-VIPGroup/A-TPT 获取。

关键词

引用

@article{arxiv.2605.19956,
  title  = {Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models},
  author = {Jia-Wei Hai and Yijun Wang and Xiu-Shen Wei},
  journal= {arXiv preprint arXiv:2605.19956},
  year   = {2026}
}

备注

Accepted by ICML 2026, Project Page: this https, URL Code URL: this https URL