中文

CoFFT: 用于视觉语言模型的链式前瞻聚焦思维

计算机视觉与模式识别 2025-10-02 v3

摘要

尽管视觉语言模型(VLMs)取得了显著进展,但它们仍受限于视觉输入的复杂性和冗余性。当图像包含大量无关信息时,VLMs容易受到干扰,从而产生过多与任务无关的推理过程,甚至产生幻觉。这一局限性源于它们在推理过程中无法精确发现和处理所需区域。为解决这一局限,我们提出了链式前瞻聚焦思维(CoFFT),一种通过模拟人类视觉认知来增强VLMs视觉推理的新型无需训练的方法。每个前瞻聚焦思维包含三个阶段:(1)多样化样本生成:生成多样化的推理样本以探索可能的推理路径,每个样本包含若干推理步骤;(2)双前瞻解码:基于视觉焦点和推理进展严格评估这些样本,将最优样本的第一步添加到推理过程中;(3)视觉焦点调整:在返回阶段(1)生成后续推理样本之前,精确调整视觉焦点至对未来推理最有益的区域。这些阶段迭代运行,形成一个推理引导视觉焦点、视觉焦点反过来指导后续推理的相互依赖循环。在Qwen2.5-VL、InternVL-2.5和Llava-Next上的多基准实证结果表明,在可控的计算开销增加下,性能持续提升3.1–5.8%。

关键词

引用

@article{arxiv.2509.22010,
  title  = {CoFFT: Chain of Foresight-Focus Thought for Visual Language Models},
  author = {Xinyu Zhang and Yuxuan Dong and Lingling Zhang and Chengyou Jia and Zhuohang Dang and Basura Fernando and Jun Liu and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2509.22010},
  year   = {2025}
}