学习何时观察:基于解耦课程的多模态推理中的战略感知
计算机视觉与模式识别
2025-12-22 v1
摘要
多模态大语言模型(MLLM)在复杂的、长链的视觉推理任务中展现出巨大的潜力,但在这些任务中仍显脆弱。一个关键的失败模式是“视觉遗忘”,即随着推理的延长,模型逐渐丢失视觉 grounding,正如“越想得越久,越看不见”所描述的那样。我们认为,这一失败源于当前训练范式过早地 entangled 两种不同的认知技能:(1)抽象逻辑推理“如何思考”和(2)战略视觉感知“何时观察”。这导致了一个根本性的 cold-start 缺陷——削弱了抽象推理,以及战略感知缺陷,因为模型缺乏何时感知的策略。在本文中,我们提出了一种基于课程的新型框架来解耦这些技能。首先,我们引入一种解耦的监督微调(SFT)课程,在仅使用文本数据上构建稳健的抽象推理主干,随后通过一种新颖的感知 grounding 链路推理(PG-CoT)范式将其锚定到视觉任务中。其次,通过将时机问题形式化为强化学习问题来解决战略感知缺陷。我们设计了 Pivotal 感知奖励,通过将感知动作与认知不确定性(如“等待”、“验证”)的语言标记相耦合,来教授模型何时观察,从而学习一个自主的 grounding 策略。我们的贡献包括对这两种缺陷的形式化化定义,以及开发一种原则性的两阶段框架来解决这些问题,将模型从一个以启发式为导向的观察者,转变为一个具备战略性和 grounding 能力的推理者。\textbf{代码}:\url{https://github.com/gaozilve-max/learning-when-to-look}。
引用
@article{arxiv.2512.17227,
title = {Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning},
author = {Siqi Yang and Zilve Gao and Haibo Qiu and Fanfan Liu and Peng Shi and Zhixiong Zeng and Qingmin Liao and Lin Ma},
journal= {arXiv preprint arXiv:2512.17227},
year = {2025}
}