中文

面向结构推理与 token 合并的否定感知 VLMs

计算机视觉与模式识别 2026-03-24 v2 人工智能

摘要

最先进的视觉语言模型(VLMs)在理解否定方面存在严重缺陷,常被称为肯定偏见(affirmative bias)。这一局限在描述对象检测(DOD)任务中尤为突出。为此,我们提出两项主要贡献:(1)一个新的数据管道;(2)一种新型轻量级适配方案。首先,我们引入 CoVAND,这是一个基于系统性链式思维(chain-of-thought, CoT)和 VQA 驱动的管道,用于生成高质量、与实例对齐的否定数据。其次,我们提出 NegToMe,这是一个新的文本 token 合并模块,直接针对肯定偏见的结构性损失进行处理,将否定词与属性合并为连贯的语义短语。它在输入层面维持正确的极性,从而即使在数据有限的情况下也能实现稳健的否定理解。例如,为防止模型将碎片化的 token "not" 和 "girl" 简单地误解为 "girl",NegToMe 将其合并为单个 token,其含义与 "girl" 单独使用时不同。该模块集成到一种参数高效且策略性的 LoRA 微调方法中。在具有挑战性的否定基准测试上,我们的方法显著提升了性能,误报率降低,NMS-AP 在 OVDEval 上提升最高可达 +10.8 分,并显示出对 SoTA VLMs 的良好泛化。本工作为解决实际检测应用中的否定理解问题迈出了关键一步。

关键词

引用

@article{arxiv.2510.13232,
  title  = {What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging},
  author = {Inha Kang and Youngsun Lim and Seonho Lee and Jiho Choi and Junsuk Choe and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2510.13232},
  year   = {2026}
}

备注

56 pages