TTP:面向对抗检测与鲁棒适应的测试时填充
计算机视觉与模式识别
2026-03-24 v2 人工智能
摘要
视觉语言模型(VLM)如 CLIP 已取得惊人的零样识别性能,但对对抗扰动极其敏感,在安全关键场景中构成重大风险。先前的训练时防御依赖对抗微调,需标注数据和高昂的重新训练成本;而现有测试时策略难以可靠区分干净输入与对抗输入,从而阻碍对抗鲁棒性和干净准确率达到最优。为此,本文提出测试时填充(TTP),一种轻量级防御框架,在推理阶段执行对抗检测后进行针对性适应。TTP 通过计算 CLIP 特征嵌入在空间填充前后的余弦相似度偏移,识别对抗输入,构建跨架构和数据集的通用阈值,实现可靠检测。对于检测到的对抗样本,TTP 使用可训练填充恢复注意力模式,结合相似度感知的集成策略以提升最终预测鲁棒性;对干净输入,TTP 默认保持不变,或可选集成现有测试时适应技术以进一步提升准确率。在多样化的 CLIP 主干网络和细粒度基准测试上进行全面实验,显示 TTP 持续超越当前最先进的测试时防御方法,在不牺牲干净准确率的前提下显著提升对抗鲁棒性。本文代码将很快公开。
引用
@article{arxiv.2512.16523,
title = {TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models},
author = {Zhiwei Li and Yitian Pang and Weining Wang and Zhenan Sun and Qi Li},
journal= {arXiv preprint arXiv:2512.16523},
year = {2026}
}
备注
Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026