揭示物理世界语义漏洞:红外视觉语言模型的通用对抗性补丁
计算机视觉与模式识别
2026-04-06 v1
摘要
红外视觉语言模型(IR-VLMs)作为低可见性环境中多模态感知的有前景的范式,然而其对对抗攻击的鲁棒性仍大体未被探索。现有对抗性补丁方法主要针对基于RGB的模型在封闭集合设置下设计,难以应用于红外VLMs的开放式语义理解和物理部署要求。为弥合这一差距,我们提出了通用曲线网格补丁(UCGP),即为红外视觉语言模型所设计的通用物理对抗性补丁框架。UCGP集成了曲线网格网格(CGM)参数化,用于连续、低频率和可部署的补丁生成,同时采用统一的表示驱动目标,以促进子空间偏离、拓扑扰动和隐蔽性。为提高在实际部署和域迁移下的鲁棒性,我们进一步融入了元差分进化和EOT增强的TPS变形建模。不同于操纵标签或提示,UCGP直接扰乱视觉表示空间,削弱跨模态语义对齐。大量实验表明,UCGP在保持跨模型可迁移性、跨数据集泛化性、实际物理有效性和抗防御鲁棒性的同时,一致性地破坏了多样化红外VLMs架构下的语义理解。这些发现揭示了当前红外多模态系统中此前被忽视的鲁棒性漏洞。
引用
@article{arxiv.2604.03117,
title = {Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patches for Infrared Vision-Language Models},
author = {Chengyin Hu and Yuxian Dong and Yikun Guo and Xiang Chen and Junqi Wu and Jiahuan Long and Yiwei Wei and Tingsong Jiang and Wen Yao},
journal= {arXiv preprint arXiv:2604.03117},
year = {2026}
}