中文

对视觉语言模型关于说服性反常图像推理能力的基准测试

计算机视觉与模式识别 2024-12-17 v3 多媒体

摘要

视觉语言模型在各种任务中展现出了强大的零样本泛化能力,尤其是在与大语言模型集成时。然而,它们理解修辞和说服性视觉媒体(如广告)的能力仍有待研究。广告经常采用反常意象,利用令人惊讶的物体并置来传达共同的属性。例如,图 1 (e) 展示了一瓶具有羽毛般纹理的啤酒。这需要高级推理来推断这种反常表现意味着啤酒的轻盈。我们引入了三个新任务:多标签反常性分类、反常性陈述检索和反常物体识别,以对 VLMs 在说服性图像中反常性的理解进行基准测试。我们评估了 VLMs 如何利用反常性来推断广告的信息,并通过采用语义上具有挑战性的负样本来测试其推理能力。最后,我们通过提取对反常元素敏感的全面图像描述,开创了反常性感知的言语化。我们的发现表明:(1) 与 LLMs 相比,VLMs 缺乏高级推理能力;(2) 简单有效的策略可以提取反常性感知信息,从而实现全面的图像言语化;(3) 反常性有助于对说服性广告的理解。代码和数据将被公开。

关键词

引用

@article{arxiv.2409.10719,
  title  = {Benchmarking VLMs' Reasoning About Persuasive Atypical Images},
  author = {Sina Malakouti and Aysan Aghazadeh and Ashmit Khandelwal and Adriana Kovashka},
  journal= {arXiv preprint arXiv:2409.10719},
  year   = {2024}
}