引导内在视角:层次化与灵活的视觉 grounding 推理框架
计算机视觉与模式识别
2025-12-01 v1
摘要
能够通过动态将推理 grounded 在视觉证据上进行“图像思考”的模型,代表了多模态 AI 的重大进步。然而,复制和推进这一能力并不容易,当前方法常常陷入在端到端强化学习 (RL) 的不稳定性与监督微调 (SFT) 的刚性之间。 这导致模型要么难以学习,要么缺乏应对复杂现实场景所需的认知灵活性。 为了导航这一困境,我们引入了 GRiP (Guided Reasoning and Perception),一种新颖的两阶段训练框架,通过显式引导模型的感知焦点和逻辑路径来培育稳健且灵活的视觉 grounded 推理。 GRiP 的核心在于其认知增强的 RL 阶段,包含两个关键创新:(1) 基于 Salience-加权 IoU 奖励,激励模型优先定位使命关键对象而非平凡干扰项;(2) 多启发式奖励,通过奖励多样且逻辑有效的推理路径来鼓励认知灵活性。 初始化自 Qwen2.5-VL-7B 模型,GRiP 在多个具有挑战性的基准测试中实现了显著的性能提升。在高度具有挑战性的 TreeBench 和 V* Bench 上,GRiP 实现了开源模型的领先成绩,证明其在复杂视觉推理中的有效性。我们的工作表明,超越简单奖励,改为以认知启发的信号指导模型该看什么和如何思考,对于 unlocking 下一层次的多模态智能至关重要。代码将公开发布。
引用
@article{arxiv.2511.22172,
title = {Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning},
author = {Zhaoyang Wei and Wenchao Ding and Yanchao Hao and Xi Chen},
journal= {arXiv preprint arXiv:2511.22172},
year = {2025}
}
备注
9pages