AIM-CoT:面向视觉语言推理的主动信息驱动多模态思维链
计算机视觉与模式识别
2026-04-21 v3
摘要
交错模态思维链通过将输入图像中特定筛选的视觉证据整合到视觉语言模型的上下文中,推进了视觉语言推理(例如视觉问答 VQA)。该范式使模型能够将其推理逻辑建立在这些细节之上。因此,I-MCoT 框架的有效性取决于识别看什么(证据选择)以及何时看(插入触发)。然而,现有方法在这两方面均有不足。首先,在选择上,它们依赖注意力信号,这不可靠——尤其是在简短的文本查询与信息丰富的图像之间存在严重粒度失衡时。其次,在触发上,它们采用静态触发器,无法捕捉 VLM 对视觉证据的动态需求。为此,我们提出了一种新颖的 I-MCoT 框架——主动信息驱动的多模态思维链,旨在通过以下方式改进证据选择和插入触发:(1) 上下文增强注意力图生成(CAG),通过文本上下文增强缓解粒度失衡;(2) 主动视觉探测(AVP),通过信息觅食过程主动选择最具信息量的证据;(3) 动态注意力转移触发器(DAT),在 VLM 的注意力从文本转向视觉上下文时精确激活插入。在三个基准测试和四个骨干网络上的实验证明了 AIM-CoT 的一致优越性。我们的代码可在 https://anonymous.4open.science/r/AIMCoT 获取。
引用
@article{arxiv.2509.25699,
title = {AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning},
author = {Xiping Li and Jianghong Ma},
journal= {arXiv preprint arXiv:2509.25699},
year = {2026}
}
备注
Accepted by ACL 2026 Main Conference. 30 pages, 6 figures