中文

基于动态视觉搜索与缩放的自适应关注链推理

计算机视觉与模式识别 2025-12-08 v3

摘要

视觉语言模型(VLMs)已在各种计算机视觉任务上取得惊人的性能,但其多模态推理能力尚未得到充分探索。本文提出一种关注链(Chain-of-Focus, CoF)方法,使 VLMs 能够根据获取的视觉线索和给定问题,在关键图像区域上进行自适应聚焦和放大,从而实现高效的多模态推理。为实现此 CoF 能力,我们提出了两个阶段的训练流程,包括监督微调(SFT)和强化学习(RL)。在 SFT 阶段,我们构建了 MM-CoF 数据集,包含 3000 多个样本,来自于一个能够根据不同图像分辨率和问题自适应识别关键区域以解决视觉任务的视觉智能体。我们使用 MM-CoF 对 Qwen2.5-VL 模型进行冷启动式微调。在 RL 阶段,我们利用结果准确率和格式作为奖励,对 Qwen2.5-VL 模型进行更新,使其能够在无需人类先验知识的情况下进一步细化搜索与推理策略。我们的模型在多个基准测试上取得显著提升。在那些需要强大视觉推理能力的 V* 基准测试上,我们的模型在 224 至 4K 共 8 种图像分辨率下均优于现有 VLMs 5%,展示了所提出 CoF 方法的有效性,并促进了 VLMs 在实际应用中的更高效部署。

关键词

引用

@article{arxiv.2505.15436,
  title  = {Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs},
  author = {Xintong Zhang and Zhi Gao and Bofei Zhang and Pengxiang Li and Xiaowen Zhang and Yang Liu and Tao Yuan and Yuwei Wu and Yunde Jia and Song-Chun Zhu and Qing Li},
  journal= {arXiv preprint arXiv:2505.15436},
  year   = {2025}
}

备注

https://github.com/xtong-zhang/Chain-of-Focus