通过潜在嵌入学习混合模态链式思维推理
人工智能
2026-02-03 v1
摘要
我们研究如何将链式思维(CoT)扩展到语言之外,以更好地处理多模态推理。虽然 CoT 有助于 LLM 和 VLM 表述中间步骤,但其 text-only 形式在视觉密集型问题上往往难以应对,因为关键中间状态本质上是视觉的。我们提出 modal-mixed CoT,即将文本 token 与以潜在嵌入表示的紧凑视觉草图交织在一起。为在不削弱 VLM 原有知识和能力的前提下弥合模态差距,我们使用 VLM 自身作为编码器,并训练语言 backbone 来重构其自身中间视觉嵌入,以保证视觉潜空间的语义对齐。我们进一步附加一个基于扩散的潜在解码器,由 special control token 调用并以 VLM 的 hidden state 为条件。如此,扩散头部携带细粒度感知细节,而 VLM 指定高层意图,从而干净地解耦角色,减少对 VLM 的优化压力。训练分为两个阶段:首先在包含 text 和 latents 的轨迹上进行监督微调,目标为联合的 next-token 和 latent-reconstruction 任务;随后进行强化学习,教会何时切换模态以及如何组合长链推理。广泛的实验在 11 个多样化的多模态推理任务上表明,我们的方法在 language-only 和其他 CoT 方法中取得更好性能。我们的代码将公开发布。
引用
@article{arxiv.2602.00574,
title = {Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings},
author = {Yifei Shao and Kun Zhou and Ziming Xu and Mohammad Atif Quamar and Shibo Hao and Zhen Wang and Zhiting Hu and Biwei Huang},
journal= {arXiv preprint arXiv:2602.00574},
year = {2026}
}