SceneTAP:面向视觉语言模型的场景一致性打字对抗规划器
计算机视觉与模式识别
2025-04-09 v2 人工智能
摘要
大型视觉语言模型(LVLMs)在解释视觉内容方面显示出卓越的能力。虽然已有研究表明,这些模型对刻意放置的对抗文本具有脆弱性,但此类文本往往容易被识别为异常。在本文中,我们首次提出一种生成场景一致性打字对抗攻击的方法,这种方法在保持视觉自然性的同时误导先进的 LVLMs。我们的方法通过 LLM 驱动的代理能力,实现视觉自然性。我们提出一种基于多模态 LLM 的场景一致性打字对抗规划(SceneTAP),采用三个阶段的流程:场景理解、对抗规划和无缝集成。SceneTAP 利用链式思考推理理解场景,制定有效的对抗文本,战略性地规划其放置位置,并提供将其自然集成到图像中的详细指令。随后,一个场景一致性 TextDiffuser 跟随上述流程执行攻击,采用局部扩散机制。我们将该方法扩展到实际场景,通过打印和放置生成的补丁在物理环境中部署,展示了其实际意义。大量实验表明,所提出的场景一致性对抗文本成功误导包括 ChatGPT-4o 在内的先进 LVLMs,即使捕获物理设置新图像亦能实现。我们的评估显示,攻击成功率显著提升,同时保持视觉自然性和情境恰当性。这一工作凸显了当前视觉语言模型面对高级场景一致性对抗攻击的脆弱性,并为潜在防御机制提供了见解。
引用
@article{arxiv.2412.00114,
title = {SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments},
author = {Yue Cao and Yun Xing and Jie Zhang and Di Lin and Tianwei Zhang and Ivor Tsang and Yang Liu and Qing Guo},
journal= {arXiv preprint arXiv:2412.00114},
year = {2025}
}