中文

交错模态链律思考(Interleaved-Modal Chain-of-Thought)

计算机视觉与模式识别 2025-03-18 v2 人工智能 机器学习

摘要

链律思考(Chain-of-Thought,CoT)提示会激发大语言模型(LLM)在得出最终答案前产生一系列中间推理步骤。然而,在转向视觉语言模型(VLM)时,其文本唯一理由难以表达与原始图像之间的细粒度关联。本文提出了一种图像融合的多模态链律思考,命名为 \textbf{交错模态链律思考(Interleaved-modal Chain-of-Thought,ICoT)},生成由paired视觉和文本理由组成的序列推理步骤以推断最终答案。直观地,新型 ICoT 需要 VLM 能够生成细粒度的交错模态内容,这对当前 VLM 来说具有挑战性。鉴于所需视觉信息通常是输入图像的一部分,本文提出了 \textbf{基于注意力的选择(Attention-driven Selection,ADS)} 以实现 ICoT。ADS 仅依赖 VLM 的注意力图,无需参数化,从而成为一种即插即用策略,可泛化到各种 VLM。我们将 ADS 应用于两种不同架构的流行 VLM 上。在三个基准测试上的广泛评估表明,ICoT 提示相较于现有多模态 CoT 提示方法,在性能和可解释性方面实现了显著提升(最高提升约 14%)。

关键词

引用

@article{arxiv.2411.19488,
  title  = {Interleaved-Modal Chain-of-Thought},
  author = {Jun Gao and Yongqi Li and Ziqiang Cao and Wenjie Li},
  journal= {arXiv preprint arXiv:2411.19488},
  year   = {2025}
}

备注

CVPR 2025 Main Conference