中文

读还是忽略?面向视觉语言模型排版攻击鲁棒性与文本识别的统一基准

计算机视觉与模式识别 2025-12-16 v1

摘要

大型视觉语言模型(LVLMs)容易受到排版攻击的影响,即图像中的误导性文本会覆盖视觉理解。现有的评估协议和防御方法大多聚焦于目标识别,隐含地鼓励忽略文本以实现鲁棒性;然而,现实场景通常需要同时对目标和文本进行联合推理(例如,在阅读交通标志的同时识别行人)。为此,我们引入了一项新任务——读或忽略视觉问答(RIO-VQA),该任务将视觉问答(VQA)中的选择性文本使用形式化:模型必须根据上下文决定何时阅读文本、何时忽略文本。为进行评估,我们提出了读或忽略基准(RIO-Bench),这是一个标准化的数据集和协议,对每张真实图像,通过仅改变文本内容和问题类型提供同场景反事实(读/忽略)。使用 RIO-Bench,我们表明强 LVLMs 和现有防御方法未能平衡排版鲁棒性与文本阅读能力,凸显了改进方法的必要性。最后,RIO-Bench 使得一种新型数据驱动防御成为可能,该防御学习自适应的选择性文本使用,超越了先前非自适应的忽略文本防御方法。总体而言,本工作揭示了现有评估范围与现实需求之间的根本错位,为可靠的 LVLMs 提供了原则性路径。我们的项目页面位于 https://turingmotors.github.io/rio-vqa/。

关键词

引用

@article{arxiv.2512.11899,
  title  = {Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models},
  author = {Futa Waseda and Shojiro Yamabe and Daiki Shiono and Kento Sasaki and Tsubasa Takahashi},
  journal= {arXiv preprint arXiv:2512.11899},
  year   = {2025}
}