Zero-Shot 对抗 CLIP 的不确定性校准
计算机视觉与模式识别
2025-12-16 v1 人工智能
机器学习
摘要
CLIP 在零样本分类方面表现出强大的性能,但在对抗攻击方面仍高度脆弱。先前的对抗微调工作主要关注在干净样本和对抗样本之间的预测 logits 匹配,这忽略了不确定性校准,可能损害零样本泛化。可靠不确定性估计的常见期望是:随着输入变得更困难或偏离训练分布,预测不确定性应当增加。然而,我们经常观察到相反现象:扰动不仅降低准确率,还抑制不确定性,导致严重的误校准和不可靠的过度自信。这一被忽视的现象凸显了鲁棒性之外的关键可靠性差距。为弥合这一差距,我们提出一种新颖的对抗微调目标,考虑预测准确性和不确定性对齐。通过将 CLIP 的输出重新参数化为Dirichlet分布的浓度参数,我们提出一种统一表示,既捕获相对语义结构,又捕获预测置信度的大小。我们的目标在扰动下全面对齐这些分布,超越单一logit锚定,恢复校准的不确定性。在多个零样本分类基准测试上进行实验表明,我们的方法有效恢复校准的不确定性,同时在保持干净准确率的同时实现竞争的对抗鲁棒性。
引用
@article{arxiv.2512.12997,
title = {Calibrating Uncertainty for Zero-Shot Adversarial CLIP},
author = {Wenjing lu and Zerui Tao and Dongping Zhang and Yuning Qiu and Yang Yang and Qibin Zhao},
journal= {arXiv preprint arXiv:2512.12997},
year = {2025}
}