暴露 VIS-IR 多模态视觉语言模型脆弱性:统一的几何对抗框架及跨任务迁移性
计算机视觉与模式识别
2026-05-22 v1
摘要
视觉语言模型(Vision-Language Models, VLMs)在多模态任务上取得了显著的性能,但其在可见-红外(VIS-IR)情境下的对抗鲁棒性仍未得到充分探讨。这种缺口尤为关键,因为 VIS-IR 传感在实际感知系统中广泛应用,以支持在恶劣成像条件下的可靠理解。为此,我们提出 CFGPatch,一种针对 VIS-IR VLMs 的曲线边缘分形几何对抗性补丁框架。CFGPatch 基于三角形分形几何,将刚性直线边缘元素替换为贝塞尔曲线,既保持多尺度分形自相似性,又引入更光滑的轮廓、更丰富的方向变化以及更灵活的形变。此外,我们设计了针对可见光和红外图像的模态特定 Fraser螺旋渲染机制,以注入细粒度的纹理失真和误导性感知线索。通过将全局曲线-分形几何与局部螺旋式外观干扰相耦合,CFGPatch 同时干扰形态感知和纹理解释。我们进一步采用期望 over transformation(EOT)以提高对常见图像级变换的鲁棒性。大量实验表明,CFGPatch 能有效欺骗 VIS-IR VLMs,且在攻击效果和鲁棒性方面持续优于标准补丁基线方法。此外,针对零样态分类优化的对抗样本在图像标述和视觉问答等下游任务上表现出强大的跨任务迁移性和普适性。
引用
@article{arxiv.2605.22273,
title = {Exposing Vulnerabilities in Visible-Infrared VLMs: A Unified Geometric Adversarial Framework with Cross-Task Transferability},
author = {Xiang Chen and Yuxian Dong and Chao Li and Chengyin Hu and Jiaju Han and Fengyu Zhang and Yiwei Wei and Jiahuan Long and Jiujiang Guo},
journal= {arXiv preprint arXiv:2605.22273},
year = {2026}
}