中文

Render-of-Thought:将文本思维链渲染为图像以实现视觉潜空间推理

计算与语言 2026-04-21 v3 计算机视觉与模式识别

摘要

思维链(CoT)提示在解锁大型语言模型(LLM)的推理能力方面取得了显著成功。尽管 CoT 提示增强了推理能力,但其冗长性带来了巨大的计算开销。近期的工作通常只关注结果对齐,而缺乏对中间推理过程的监督。这些缺陷掩盖了潜在推理链的可分析性。为了应对这些挑战,我们引入了 Render-of-Thought(RoT),这是第一个通过将文本步骤渲染为图像来具象化推理链的框架,使得潜在逻辑变得显式且可追溯。具体而言,我们利用现有视觉语言模型(VLM)的视觉编码器作为语义锚点,将视觉嵌入与文本空间对齐。这种设计确保了即插即用的实现,且不会产生额外的预训练开销。在数学和逻辑推理基准上的大量实验表明,与显式 CoT 相比,我们的方法实现了 3-4 倍的 token 压缩和显著的推理加速。此外,它与其他方法相比保持了具有竞争力的性能,验证了该范式的可行性。我们的代码可在 https://github.com/TencentBAC/RoT 获取。

关键词

引用

@article{arxiv.2601.14750,
  title  = {Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning},
  author = {Yifan Wang and Shiyu Li and Peiming Li and Xiaochen Yang and Yang Tang and Zheng Wei},
  journal= {arXiv preprint arXiv:2601.14750},
  year   = {2026}
}

备注

Accepted by ACL 2026 Main Conference