超越捷径:通过定性推理缓解冻结视觉语言模型中的视觉幻觉
计算机视觉与模式识别
2026-04-30 v1
摘要
虽然视觉语言模型(VLMs)在一般视觉任务上取得了最新进展,但其感知鲁棒性在面对光学幻觉时仍显得异常脆弱。这些失败常被归因于捷径启发式,模型倾向于优先考虑语言先验和记忆原型,而非直接的视觉证据。本文提出结构化定性推理(SQI),一个无需训练、以数据为中心的框架,用于增强冻结 VLMs 的视觉 grounding。SQI 通过三个系统化模块来处理感知异常:(1)公理约束注入,抑制错误的度量估计和量化幻觉;(2)层次场景分解,解耦目标视觉流形与复杂背景干扰;(3)反事实自我验证,是一种对抗推理步骤,用于缓解确认偏见。在推理阶段编排这些定性约束后,SQI 有效地将高层语言推理与低层视觉感知对齐。该框架在 DataCV 2026 挑战(任务 I:经典幻觉理解)中进行评估,总体排名第 2。实验结果表明,SQI 不仅在 diverse illusion categories 上显著提升准确率,还在无需模型微调的情况下提供了更优的诊断可解释性。我们的成功凸显了结构化定性 grounding 作为下一代抗幻觉视觉语言系统的稳健范式的潜力。
引用
@article{arxiv.2604.26250,
title = {Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning},
author = {Hao Guo and Fei Wang and Junjie Chen and Yiqi Nie and Jiaqi Zhao and Qiankun Li and Subin Huang},
journal= {arXiv preprint arXiv:2604.26250},
year = {2026}
}
备注
4 pages, 2 figures, and 1 table. This is a methodology paper for the DataCV 2026 Challenge (CVPR Workshops), Task 1, where our method ranked 2nd