基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型的天气鲁棒性缺陷
计算机视觉与模式识别
2026-01-21 v1 人工智能
摘要
视觉-语言模型在典型视觉条件下收集的图像-文本对上进行训练,并在多模态任务中取得了强劲的性能。然而,它们对现实世界天气条件的鲁棒性,以及在这种结构化扰动下跨模态语义对齐的稳定性,仍未得到充分研究。在本文中,我们关注雨天场景,并引入了首个利用真实天气攻击 VLM 的对抗框架,使用基于语义解耦的两阶段参数化扰动模型来分析降雨引起的决策转变。在阶段 1,我们通过应用低维全局调制来调节嵌入空间并逐渐削弱原始语义决策边界,从而对降雨的全局效应进行建模。在阶段 2,我们通过显式建模多尺度雨滴外观和降雨引起的照度变化来引入结构化降雨变体,并优化由此产生的不可微天气空间以诱导稳定的语义转变。在非像素参数空间中运行,我们的框架生成的扰动既具有物理基础又具有可解释性。跨多个任务的实验表明,即使是物理上合理、高度受限的天气扰动,也能在主流 VLM 中引发实质性的语义错位,在实际部署中构成潜在的安全性和可靠性风险。消融实验进一步证实,照度建模和多尺度雨滴结构是这些语义转变的关键驱动因素。
引用
@article{arxiv.2601.13238,
title = {A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models},
author = {Chengyin Hu and Xiang Chen and Zhe Jia and Weiwen Shi and Fengyu Zhang and Jiujiang Guo and Yiwei Wei},
journal= {arXiv preprint arXiv:2601.13238},
year = {2026}
}