中文

通过图像感知属性缩减进行视觉定位的对抗性测试

计算机视觉与模式识别 2024-03-05 v1 人工智能

摘要

由于融合多模态信息的优势,多模态学习正受到越来越多的关注。作为多模态学习的一项基本任务,视觉定位 (VG) 旨在通过自然语言表达式定位图像中的物体。由于任务的复杂性,确保 VG 模型的质量面临着重大挑战。在黑盒场景下,现有的对抗性测试技术往往无法充分利用两种模态信息的潜力。它们通常仅基于图像或文本信息施加扰动,忽视了两种模态之间至关重要的相关性,这将导致测试预言机失败或无法有效挑战 VG 模型。为此,我们提出了 PEELING,这是一种通过图像感知属性缩减进行 VG 模型对抗性测试的文本扰动方法。其核心思想是减少原始表达式中与属性相关的信息,同时确保缩减后的表达式仍能唯一描述图像中的原始物体。为实现这一目标,PEELING 首先进行物体和属性提取及重组,以生成候选属性缩减表达式。然后,它通过利用视觉理解技术查询图像,选择那些能准确描述原始物体且确保图像中没有其他物体满足该表达式的合格表达式。我们在最先进的 VG 模型(即 OFA-VG)上评估了 PEELING,涉及三个常用数据集。结果表明,PEELING 生成的对抗性测试在多模态影响分数 (MMI) 上达到 21.4%,并在图像和文本方面优于最先进基线 8.2%--15.1%。

关键词

引用

@article{arxiv.2403.01118,
  title  = {Adversarial Testing for Visual Grounding via Image-Aware Property Reduction},
  author = {Zhiyuan Chang and Mingyang Li and Junjie Wang and Cheng Li and Boyu Wu and Fanjiang Xu and Qing Wang},
  journal= {arXiv preprint arXiv:2403.01118},
  year   = {2024}
}

备注

14pages, 6 figures