中文

Sketch-in-Latents:在多模态大语言模型中引导统一推理

计算机视觉与模式识别 2025-12-19 v1

摘要

虽然多模态大语言模型(MLLM)通过文本推理在视觉理解任务中表现出色,但在需要视觉想象的场景中常常不足。不同于当前采用预定义外部工具或在推理过程中生成图像的方法,然而人类可以在思考过程中无需预定义工具即可形成灵活的视觉-文本想象与交互,其中一个重要原因是人类将视觉-文本思考过程构建在大脑中的统一空间中。鼓舞于此,我们认为由于当前 MLLM 已将视觉和文本信息编码在同一特征空间中,视觉标记可以无缝地插入由文本标记承载的推理过程中,理想情况下,所有视觉想象过程都可以由潜在特征编码。为实现这一目标,我们提出了 Sketch-in-Latents(SkiLa),这是一种用于统一多模态推理的新范式,其扩充了 MLLM 的自回归能力,使其能够原生生成连续视觉嵌入,称为潜在草图标记(latent sketch tokens),作为视觉思考。 在多步推理期间,模型在文本思考模式和视觉绘图模式之间动态交替,后者用于生成潜在草图标记。我们提出了一种潜在视觉语义重建机制,以确保这些潜在草图标记在语义上是可靠的。广泛的实验表明,SkiLa 在视觉中心任务上实现了优异性能,同时在多样化的通用多模态基准测试中展现出强大的泛化能力。代码将在 https://github.com/TungChintao/SkiLa 发布。

关键词

引用

@article{arxiv.2512.16584,
  title  = {Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs},
  author = {Jintao Tong and Jiaqi Gu and Yujing Lou and Lubin Fan and Yixiong Zou and Yue Wu and Jieping Ye and Ruixuan Li},
  journal= {arXiv preprint arXiv:2512.16584},
  year   = {2025}
}

备注

14 pages, 11 figures