中文

看得更少,看得更准:用于多模态推理的双向感知塑造

计算机视觉与模式识别 2026-02-06 v2

摘要

大型视觉语言模型(VLM)通常受益于中间视觉线索,这些线索要么通过外部工具注入,要么在推理过程中作为潜在视觉标记生成,但这些机制仍然忽视细粒度的视觉证据(例如,图表中的折线),跨领域泛化能力差,并且推理成本高。在本文中,我们提出了双向感知塑造(BiPS),它将问题条件化的掩蔽视图转换为双向“看哪里”信号,在训练期间塑造感知。BiPS首先在原始图像和仅保留问题相关区域的证据保留视图之间应用KL一致性约束,鼓励对支持像素进行粗略但完整的覆盖。然后,它在原始图像和证据消除视图之间应用KL分离约束,其中关键像素被掩蔽,使得图像不再支持原始答案,从而阻止仅文本捷径(即仅从文本回答)并强制细粒度的视觉依赖。在八个基准上,BiPS平均将Qwen2.5-VL-7B提升了8.2%,并显示出对未见数据集和图像类型的强大跨域泛化能力。

关键词

引用

@article{arxiv.2512.22120,
  title  = {See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning},
  author = {Shuoshuo Zhang and Yizhen Zhang and Jingjing Fu and Lei Song and Jiang Bian and Yujiu Yang and Rui Wang},
  journal= {arXiv preprint arXiv:2512.22120},
  year   = {2026}
}