中文

视觉潜在变量知道的比语言更多:唤醒潜在推理于 MLLMs

机器学习 2026-05-05 v1

摘要

连续潜在空间推理为多模态模型提供了文本链式思考的紧凑替代方案,使高维视觉证据能够无需显式推理标记地整合。然而,我们发现现有潜在视觉推理方法中存在一个被忽视的优化病态:尽管视觉潜在变量在训练期间变得语义丰富,但其对最终答案预测的贡献被系统性地压制。在共享参数空间中,自回归目标倾向于依赖直接视觉输入,导致潜在变量趋向于类似状态,而非信息丰富的推理内容。我们称之为沉默的视觉潜在变量。为此,我们通过在推断时直接优化潜在推理来分离这两个冲突目标,保持主干参数冻结。在阶段 I 中,通过查询引导的对比潜在-视觉对齐 warming up 视觉潜在变量,提高其语义质量,防止潜在变量崩溃。在阶段 II 中,通过置信度递进奖励进一步优化潜在推理,该奖励激励沿潜在跨度预测的标记分布变得越来越集中,将预测路由通过潜在推理而非旁路。基于八个基准测试和四个模型主干的实验表明,推断时的最佳潜在优化(无需任何参数更新)有效释放了被压制的视觉潜在变量的推理能力。

关键词

引用

@article{arxiv.2605.02735,
  title  = {Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs},
  author = {Xin Zhang and Qiqi Tao and Jiawei Du and Moyun Liu and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2605.02735},
  year   = {2026}
}