SIFThinker:面向视觉推理的空间感知图像聚焦
计算机视觉与模式识别
2025-12-29 v5 人工智能
摘要
当前的多模态大语言模型(multimodal large language models, MLLMs)在复杂的视觉任务(例如空间理解、细粒度感知)中仍然面临重大挑战。先前的方法试图融入视觉推理,但未能利用带有空间线索的注意力校正来迭代地细化其对提示相关区域的聚焦。在本文中,我们引入了SIFThinker,这是一个模拟人类视觉感知的空间感知“以图思考”框架。具体而言,SIFThinker通过交错使用深度增强的边界框和自然语言来实现注意力校正和图像区域聚焦。我们的贡献有两点:首先,我们引入了一种反向-扩展-前向推理策略,该策略有助于生成交错的图文思维链,用于过程级监督,进而构建了SIF-50K数据集。此外,我们提出了GRPO-SIF,这是一种将深度信息融入视觉定位的强化训练范式,将其整合到统一的推理流程中,教导模型动态地校正并聚焦于提示相关的区域。大量实验表明,SIFThinker在空间理解和细粒度视觉感知方面优于最先进的方法,同时保持了强大的通用能力,凸显了我们方法的有效性。代码:https://github.com/zhangquanchen/SIFThinker。
引用
@article{arxiv.2508.06259,
title = {SIFThinker: Spatially-Aware Image Focus for Visual Reasoning},
author = {Zhangquan Chen and Ruihui Zhao and Chuwei Luo and Mingze Sun and Xinlei Yu and Yangyang Kang and Ruqi Huang},
journal= {arXiv preprint arXiv:2508.06259},
year = {2025}
}
备注
15 pages, 13 figures