FPT-Noise:面向视觉语言模型测试时对抗防御的动态场景感知反制噪声
密码学与安全
2025-10-27 v1
摘要
视觉语言模型(VLM),如CLIP,已在多种下游任务中展现出卓越的零样本泛化能力。然而,近期研究表明,包括CLIP在内的VLM极易受到对抗性攻击,尤其是在其视觉模态上。传统的提升对抗鲁棒性的方法,如对抗训练,涉及大量的重新训练且计算成本高昂。本文提出了一种新的测试时防御方法:特征感知阈值对抗噪声(FPT-Noise),该方法无需昂贵的微调即可增强CLIP的对抗鲁棒性。我们的核心贡献有三点:首先,我们引入了一个动态特征调制器,能够动态生成图像特定且攻击自适应的噪声强度参数。其次,我们重新分析了CLIP的图像特征。当图像暴露于不同级别的噪声时,干净图像和对抗图像表现出不同的特征变化率。我们建立了一个特征感知阈值来区分干净图像和受攻击图像。最后,我们整合了一个由稳定性阈值引导的场景感知调节机制,并利用测试时变换集成(TTE)来进一步减轻残余噪声的影响并增强鲁棒性。大量实验表明,FPT-Noise显著优于现有的测试时防御方法,在AutoAttack下将平均鲁棒准确率从0.07%提升至56.86%,同时在干净图像上保持了高性能(-1.1%)。代码将在研究发表后公开。
引用
@article{arxiv.2510.20856,
title = {FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models},
author = {Jia Deng and Jin Li and Zhenhua Zhao and Shaowei Wang},
journal= {arXiv preprint arXiv:2510.20856},
year = {2025}
}
备注
11pages,4figures