面向否定理解的视觉语言模型负迁移适应
计算机视觉与模式识别
2025-08-06 v2
摘要
本文研究了视觉语言模型(VLM)中关于否定理解的实际但较少考察的问题。具体而言,许多实际应用需要模型显式识别哪些内容是虚假的或不存在的,例如医生可能会搜索排除特定条件的图像。尽管大规模训练使 VLM 具备了惊人的可迁移性,但它们仍受限于无法处理否定问题。为此,现有方法认为其根源在于否定训练数据匮乏,故提出通过在大量包含显式否定的数据上微调 VLM 来解决。显然,这类数据中心解决方案需要大量数据和计算资源,限制了其可持续普及。为此,我们经验性地发现,关键障碍在于肯定与否定分布之间的双重概念偏移。因此,我们提出了一种 Negation-Aware Test-Time Adaptation(NEAT)方法,以在推理期间高效调整与分布相关的可训练参数。在简要而言,NEAT 能在一致语义下减少分布偏移,同时消除无关语义中的错误分布一致性。广泛的实验在各种否定理解任务上验证了所提方法的有效性。值得注意的是,NEAT 仅使用不到 0.01% 的可训练参数,便实现了相当于或优于当前最先进的后训练方法的性能。我们的代码已公开于 https://github.com/hhc1997/NEAT。
引用
@article{arxiv.2507.19064,
title = {Negation-Aware Test-Time Adaptation for Vision-Language Models},
author = {Haochen Han and Alex Jinpeng Wang and Fangming Liu and Jun Zhu},
journal= {arXiv preprint arXiv:2507.19064},
year = {2025}
}
备注
This paper will be submitted to the IEEE for possible publication