ImgCoT:将长链式思维压缩为紧凑视觉标记以提高大语言模型的推理效率
计算机视觉与模式识别
2026-02-02 v1 人工智能
摘要
将长链式思维(CoT)压缩为紧凑的潜在标记对于高效地使用大型语言模型(LLM)进行推理至关重要。最近的研究采用自编码器实现这一目标,通过重构潜在标记中的文本CoT,从而对CoT语义进行编码。然而,将文本CoT作为重构目标迫使潜在标记保留表层语言特征(如词汇选择和语法),引入强大的语言归纳偏置,使其优先考虑语言形式而非推理结构,从而限制了逻辑抽象。因此,我们提出ImgCoT,将重构目标从文本CoT替换为通过渲染CoT获得的视觉CoT。这用空间归纳偏置取代了语言偏置,即倾向于建模视觉CoT中推理步骤的空间布局,从而使潜在标记能够更好地捕获全局推理结构。此外,虽然视觉潜在标记编码了抽象推理结构,但可能会模糊推理细节。我们因此提出一种宽松版ImgCoT,一种混合推理,通过基于低标记对数概率选择的少量关键文本推理步骤来增强视觉潜在标记。这种设计允许LLM在比完整CoT更少的标记数量下同时保留全局推理结构和细粒度推理细节。对多个数据集和LLM进行大量实验,表明两种ImgCoT版本都有效。
引用
@article{arxiv.2601.22730,
title = {ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model},
author = {Xiaoshu Chen and Sihang Zhou and Ke Liang and Taichun Zhou and Xinwang Liu},
journal= {arXiv preprint arXiv:2601.22730},
year = {2026}
}