中文

Uni-cot:面向文本与视觉的统一链式思考推理

计算机视觉与模式识别 2026-03-03 v3 计算与语言

摘要

链式思考(Chain-of-Thought,CoT)推理已被广泛采用以增强大语言模型(LLM),通过将复杂任务分解为更简单的、顺序的子任务。然而,将CoT扩展到视觉语言推理任务仍具有挑战性,因为这通常需要解释视觉状态的转换以支持推理。现有方法常因建模视觉状态转换能力有限或因片段化架构导致视觉轨迹不连贯而难以处理。为克服这些限制,我们提出Uni-cot——一个统一链式思考框架,使其能在单个统一模型中实现连贯且扎实的多模态推理。核心思想是利用一种既能理解图像又能生成的模型,对视觉内容进行推理并建模演化中的视觉状态。然而,在计算成本高和训练负担大的前提下,赋予统一模型实现这一点并不容易。为此,Uni-cot引入一种新颖的两层推理范式:用于高层次任务规划的宏观层CoT,以及用于子任务执行的微观层CoT。这种设计显著降低了计算开销。此外,我们引入一种结构化训练范式,将交错的图像-文本监督用于宏观层CoT,同时针对微观层CoT采用多任务目标。正是这些创新,使得Uni-cot能够进行可扩展且连贯的多模态推理。此外,凭借我们的设计,所有实验仅需8个80GB A100 GPU即可高效完成。在推理驱动的图像生成基准(WISE)和编辑基准(RISE和KRIS)上的实验结果表明,Uni-cot在各项指标上均实现最先进(SOTA)性能并展现出强大的泛化能力,使其成为多模态推理的有前景的解决方案。项目页面与代码:https://sais-fuxi.github.io/projects/uni-cot/

关键词

引用

@article{arxiv.2508.05606,
  title  = {Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision},
  author = {Luozheng Qin and Jia Gong and Yuqing Sun and Tianjiao Li and Mengping Yang and Xiaomeng Yang and Chao Qu and Zhiyu Tan and Hao Li},
  journal= {arXiv preprint arXiv:2508.05606},
  year   = {2026}
}

备注

Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/