中文

视觉说服:影响视觉语言模型决策的因素

计算机视觉与模式识别 2026-02-18 v1 人工智能

摘要

Web上充斥着图片,这些图片最初为人类消费,现在越来越多地被视觉语言模型(VLMs)所解释。这些模型在大规模决策中进行视觉判断,决定点击、推荐或购买。然而,我们对它们的视觉偏好结构知之甚少。我们提出一种研究框架,通过将VLMs置于受控的图像选择任务中并系统性地扰动其输入来实现此目标。我们的核心思想是将代理的决策函数视为可通过显露偏好推断的潜在视觉效用:在系统性编辑后的图像之间进行选择。从常见图像(如产品照片)开始,我们提出了视觉提示优化方法,改编文本优化方法,迭代提议并应用符合视觉可行性的修改(如构图、光照或背景),以图像生成模型为基础。我们随后评估哪些编辑会增加选择概率。通过在前沿VLMs上进行大规模实验,我们证明优化后的编辑在头对头比较中显著偏移选择概率。我们开发了自动可解释性管道来解释这些偏好,识别出驱动选择的一致视觉主题。我们认为,这种方法为表现视觉脆弱性、潜在的安全问题提供了一种实用且高效的方式,这些问题原本可能在野外被动发现,从而支持更主动的AI代理进行审计和治理。

关键词

引用

@article{arxiv.2602.15278,
  title  = {Visual Persuasion: What Influences Decisions of Vision-Language Models?},
  author = {Manuel Cherep and Pranav M R and Pattie Maes and Nikhil Singh},
  journal= {arXiv preprint arXiv:2602.15278},
  year   = {2026}
}

备注

45 pages, 17 figures