当光照欺骗:通过光照变换攻击暴露视觉语言模型的光照脆弱性
计算机视觉与模式识别
2025-03-24 v2
摘要
视觉语言模型(VLM)在各种任务中取得了显著成功,但它们对真实世界光照变化的鲁棒性在很大程度上仍未被探索。为了弥补这一空白,我们提出了光照变换攻击(ITA),这是第一个系统评估 VLM 对光照变化鲁棒性的框架。然而,仍然存在两个关键挑战:(1) 如何以细粒度控制对全局光照进行建模以实现多样化的光照条件,以及 (2) 如何在保持自然性的同时确保对抗有效性。为了解决第一个挑战,我们基于光照渲染方程创新地将全局光照分解为多个参数化的点光源。这种设计使我们能够对以往方法无法捕捉的更多样化的光照变化进行建模。然后,通过将这些参数化的光照变化与基于物理的光照重建技术相结合,我们能够在原始场景中精确渲染此类光照交互,最终实现细粒度光照控制的目标。对于第二个挑战,通过光照重建模型的潜在空间而非直接操作像素来控制光照,我们本质上保留了物理光照先验。此外,为了防止潜在的重建伪影,我们设计了额外的感知约束以保持与原始图像的视觉一致性,以及多样性约束以避免光源收敛。大量实验表明,我们的 ITA 能够显著降低先进的 VLM(如 LLaVA-1.6)的性能,同时具备竞争力的自然性,暴露了 VLM 关键的光照脆弱性。
引用
@article{arxiv.2503.06903,
title = {When Lighting Deceives: Exposing Vision-Language Models' Illumination Vulnerability Through Illumination Transformation Attack},
author = {Hanqing Liu and Shouwei Ruan and Yao Huang and Shiji Zhao and Xingxing Wei},
journal= {arXiv preprint arXiv:2503.06903},
year = {2025}
}