解码视觉语言模型在多图像理解任务中的推理脉冲
计算机视觉与模式识别
2026-05-11 v2 人工智能
摘要
多图像推理是视觉语言模型 (VLM) 的重要挑战。我们调查了一个被忽视的现象:在 chain-of-thought (CoT) 生成期间,文本到图像 (T2I) 注意力显示出漫散的“脉冲”:不聚焦于任务相关图像的间歇性和不聚焦的注意力模式。我们进一步揭示了注意力在图像间分配中的系统性位置偏差。鼓励这些观察,我们提出了 PulseFocus,一种训练自由、推理时的 method,将 CoT 推理结构化为交错的 plan/focus 块,并采用软注意力门控。通过迫使模型显式规划要检查哪幅图像,然后对解码时的注意力进行门控以引用该图像,PulseFocus 锐化了注意力聚焦并在多图像基准测试中实现持续的改进,例如 BLINK 基准测试 (+3.7%) 和 MuirBench (+1.07%)。
关键词
引用
@article{arxiv.2603.04676,
title = {Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks},
author = {Chenjun Li},
journal= {arXiv preprint arXiv:2603.04676},
year = {2026}
}
备注
This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work