中文

ChainV:原子级视觉提示使多模态推理更短更好

计算机视觉与模式识别 2025-11-24 v1

摘要

近期在多模态推理模型方面的进展展现了惊人的能力,涵盖文本与视觉。然而,即便是领先模型在生成冗长推理链时也会出现冗余的自我反思。虽然训练自由的CoT压缩方法在大语言模型领域涌现,但它们依赖静态视觉参考,对多模态推理的提升有限。因此,我们提出ChainV框架,动态整合视觉提示以推进推理过程,从而使多模态推理更短更好。具体而言,ChainV首先基于前一步的推理进行粗糙的视觉块选择,然后通过识别注意力强度平均值最高的原子级视觉提示进行细化。此外,ChainV引入一种基于一致性的评估机制,来评估所选提示的可靠性,指导模型自适应地调整自我反思程度。最终,所选视觉提示的像素坐标及其可靠性将通过伯努利随机过程纳入思考过程。实验表明,我们的方法显著提升了推理准确率与效率,尤其在视觉提示对多步骤符号推理至关重要的数学基准测试上效果更为突出。例如,ChainV在MIMO-VL-RL上的MathVista上实现了2.3%2.3\%的提升,同时将推理延迟降低51.4%51.4\%,缩短输出标记长度24.5%24.5\%

关键词

引用

@article{arxiv.2511.17106,
  title  = {ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better},
  author = {Yuan Zhang and Ming Lu and Junwen Pan and Tao Huang and Kuan Cheng and Qi She and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2511.17106},
  year   = {2025}
}

备注

16 pages