中文

盲区导航:发现 LVLMs 敏感语义概念的进化方法

计算机视觉与模式识别 2025-07-28 v2 人工智能 密码学与安全

摘要

对抗性攻击旨在生成误导深度模型的恶意输入,但仅能引发模型失效,却无法提供诸如“\textit{输入中的哪些内容使模型更易于失效?}”等特定可解释信息。这种信息对改进模型鲁棒性至关重要。最近的研究表明,模型可能对视觉输入中的特定语义(如“湿润”“雾霾”)特别敏感,从而容易出错。鼓舞此思路,本文首次探索大型视觉语言模型(LVLMs),发现 LVLMs 在面对图像中的特定语义概念时确实容易产生幻觉和各种错误。为高效搜索这些敏感概念,我们整合大型语言模型(LLMs)和文本到图像(T2I)模型,提出一种新颖的语义演化框架。随机初始化的语义概念经 LLM 驱动的交叉和变异操作形成图像描述,再由 T2I 模型转换为视觉输入供 LVLMs 使用。任务特定的 LVLMs 性能在每个输入上的得分作为涉及的语义的适应度分数,用作指导 LLMs 进一步探索可导致 LVLMs 失效的概念。对七个主流 LVLMs 和两个多模态任务的大量实验表明,我们的方法有效。此外,我们提供了关于 LVLMs 敏感语义的有趣发现,旨在激发进一步深入的研究。

关键词

引用

@article{arxiv.2505.15265,
  title  = {Blind Spot Navigation: Evolutionary Discovery of Sensitive Semantic Concepts for LVLMs},
  author = {Zihao Pan and Yu Tong and Weibin Wu and Jingyi Wang and Lifeng Chen and Zhe Zhao and Jiajia Wei and Yitong Qiao and Zibin Zheng},
  journal= {arXiv preprint arXiv:2505.15265},
  year   = {2025}
}

备注

The paper needs major revisions, so it is being withdrawn