中文

让我们高效地利用图像思考!一种具有动态且精确视觉思维的交叉模态思维链推理框架

计算机视觉与模式识别 2026-03-24 v1 人工智能

摘要

近年来,交错模态思维链推理通过同时利用多模态输入与输出取得了显著成功,并吸引了越来越多的关注。尽管取得了有前景的性能,当前的 ICoT 方法仍存在两大局限:(1)静态视觉思维定位,即在固定步骤静态插入视觉信息,导致推理效率低下且不灵活;(2)断裂的视觉思维表征,涉及不连续且语义不连贯的视觉词元。为了解决这些局限,我们提出了具有动态与精确视觉思维的交错模态思维链推理,该框架包含两个关键组件:(1)动态视觉思维集成,根据推理需求自适应地引入视觉输入,减少冗余并提高效率;(2)精确视觉思维引导,确保视觉语义连贯且上下文对齐的表征。在多个基准和模型上的实验表明,DaP-ICoT 达到了最先进的性能。此外,DaP-ICoT 显著减少了插入图像的数量,使词元消耗降低了 72.6%,从而实现了更高效的 ICoT 推理。

关键词

引用

@article{arxiv.2603.21754,
  title  = {Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts},
  author = {Xu Liu and Yongheng Zhang and Qiguang Chen and Yao Li and Sheng Wang and Libo Qin},
  journal= {arXiv preprint arXiv:2603.21754},
  year   = {2026}
}

备注

Accepted by AAAI 2026