中文

Deliberate-to-Intuitive:解锁多模态 LLM 测试时推理能力

计算机视觉与模式识别 2026-05-28 v2 计算与语言 机器学习

摘要

推理是大型语言模型(LLM)的关键尤其是在数学问题解决等复杂任务中。然而,多模态推理面临模态对齐和训练可扩展性挑战,许多现有方法依赖额外标注或复杂规则奖励。为此,我们提出了 Deliberate-to-Intuitive 推理框架(D2I),在无额外标注或复杂奖励的情况下提升多模态 LLM(MLLM)的理解与推理能力。在训练期间,D2I 使用仅由规则格式奖励监督的深入推理策略以增强模态对齐。在推理期间,它转为直观推理通过移除这些显式策略允许模型在其响应中隐式应用所学能力。D2I 在域内和域外基准上均优于基准模型突显了格式奖励在培育可迁移多模态推理技能方面的有效性并提示分离训练时推理深度与测试时响应灵活性的益处。

关键词

引用

@article{arxiv.2507.06999,
  title  = {Learning Deliberately, Acting Intuitively: Unlocking Test-Time Reasoning in Multimodal LLMs},
  author = {Yahan Yu and Yuyang Dong and Masafumi Oyamada},
  journal= {arXiv preprint arXiv:2507.06999},
  year   = {2026}
}

备注

22 pages, 24 figures