中文

基于置信度加权的视觉语言模型零样态鲁棒性

计算机视觉与模式识别 2025-10-06 v1

摘要

视觉语言模型如 CLIP 在零样态泛化方面表现出色,但对对抗攻击仍高度脆弱。本文我们提出置信度感知加权(CAW)以增强视觉语言模型的零样态鲁棒性。CAW 包含两个组件:(1)置信度感知损失,通过对干净和对抗预测之间的 KL 发散进行比例缩放,以优先处理不确定的对抗样本;(2)特征对齐正则化,通过最小化冻结和微调后图像编码器在对抗输入上的距离,来保持语义一致性。这两个组件协同工作,既提升了干净和鲁棒准确度,又不损害泛化能力。在 TinyImageNet 和 14 个额外数据集上的大量实验表明,CAW 在 AutoAttack 等强攻击下,优于 PMG-AFT 和 TGA-ZSR 等最近方法,同时占用更少内存。

关键词

引用

@article{arxiv.2510.02913,
  title  = {Zero-Shot Robustness of Vision Language Models Via Confidence-Aware Weighting},
  author = {Nikoo Naghavian and Mostafa Tavassolipour},
  journal= {arXiv preprint arXiv:2510.02913},
  year   = {2025}
}

备注

Accepted to the NeurIPS 2025 Workshop on Reliable ML from Unreliable Data