TAME:基于混合专家的测试时对抗式提示调优
计算机视觉与模式识别
2026-05-19 v1
摘要
大规模预训练视觉语言模型(Vision-Language Models, VLMs),如CLIP,表现出强大的零样态泛化能力,但对不可察觉的对抗扰动极其脆弱,这引发了面向实际应用的安全隐患。为提升鲁棒性而无需针对特定下游任务进行重新训练,我们提出TAME,一种新型测试时防御方法。基于我们先前的测试时对抗式提示调优(Test-Time Adversarial Prompt Tuning, TAPT),TAME通过替换TAPT的单一自适应提示,引入基于输入的混合专家(Mixture-of-Experts, MoE)框架,实现更具表达力和适应性的防御。具体而言,TAME维护一组可学习的专家提示,采用输入依赖的路由机制为每个无标签测试样本聚合定制化的提示混合方案。该测试时防御机制由三个无监督目标驱动:(1)多视图预测熵最小化;(2)视觉标记统计量在层面上对齐到预计算的干净和对抗参考分布;(3)MoE正则化以实现专家利用的均衡和提示的多样性。我们在11个基准数据集上评估了TAME,包括ImageNet及10个额外的零样态数据集。结果表明,TAME在AutoAttack下将原始CLIP的零样态对抗鲁棒性提升至少49.1%,同时在干净样本上基本保持泛化能力。TAME在多种提示设计下均优于现有的对抗式提示调优方法,平均鲁棒性提升至少30.2%。
引用
@article{arxiv.2605.17577,
title = {TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models},
author = {Xin Wang and Yixu Wang and Jiaming Zhang and Ruofan Wang and Jiaqi Yu and Kai Chen and Jingjing Chen and Xingjun Ma and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2605.17577},
year = {2026}
}