V-Reflection:将多模态大语言模型从被动观察者转化为主动询问者
计算机视觉与模式识别
2026-04-17 v2 人工智能
摘要
多模态大语言模型(MLLMs)取得了显著的进展,但在细粒度任务中仍容易出现感知相关的幻觉。这种漏洞源于根本性限制:其推理主要局限于语言领域,将视觉输入视为静态且不参与推理的前导语gestalt,而非动态的参与者。因此,当前模型表现为被动观察者,无法重新检查视觉细节以校准其演化中的推理状态。为克服这一问题,我们提出了V-Reflection框架,通过“思考后观察”的视觉反思机制将MLLM转化为主动询问者。在推理过程中,潜在状态作为动态探针主动询问视觉特征空间,从而为每个推理步骤提供任务关键证据。我们的方法采用两阶段蒸馏策略。首先,基于盒框引导的压缩模块(BCM)通过显式空间对齐建立稳定的像素到潜在目标。接下来,动态自回归压缩(DAC)模块将模型的隐藏状态映射为动态探针,以询问全局视觉特征图。通过将BCM教师的空间专长蒸馏到DAC学生中,V-Reflection内化了局部任务关键证据的能力。在推理时,两个模块完全保持静默,维持基于潜在空间的纯端到端自回归解码,具有最佳效率。广泛的实验表明,V-Reflection在六个感知密集型基准测试中均显著缩小了细粒度感知差距。可视化结果确认,潜在推理能够自主局部化任务关键视觉证据。
引用
@article{arxiv.2604.03307,
title = {V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators},
author = {Jiazhou Zhou and Yucheng Chen and Hongyang Li and Qing Jiang and Hu Zhou and Ying-Cong Chen and Lei Zhang},
journal= {arXiv preprint arXiv:2604.03307},
year = {2026}
}
备注
Main paper 14 pages with supplementary 7 pages