中文

拓宽视野,深化思考:跨模态协作链路思维用于复杂视觉推理

计算机视觉与模式识别 2026-01-07 v1 人工智能

摘要

多模态推理需要视觉与语言线索的无缝集成,但现有的链链思维方法在跨模态场景中存在两个关键局限:(1) 过度依赖单一粗粒度图像区域,(2) 连续推理步骤之间的语义碎片化。为此,我们提出CoCoT(Collaborative Cross-modal Thought)框架,基于两个关键创新:a) 动态多区域 grounding 以适应问题检测最相关图像区域,b) 基于关系的推理以实现多区域协作,通过迭代对齐视觉线索形成连贯且逻辑的链路思维。通过此方法,我们构建CoCoT-70K数据集,包含74,691个高质量样本,涉及多区域标注和结构化推理链。大量实验表明,CoCoT显著提升复杂视觉推理,在LLaVA-1.5上实现平均准确率提升15.4%,在Qwen2-VL上提升4.0%,并在六个具有挑战性的基准测试中取得佳绩。数据与代码已公开:https://github.com/deer-echo/CoCoT。

关键词

引用

@article{arxiv.2601.02422,
  title  = {Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning},
  author = {Wenting Lu and Didi Zhu and Tao Shen and Donglin Zhu and Ayong Ye and Chao Wu},
  journal= {arXiv preprint arXiv:2601.02422},
  year   = {2026}
}