借助低级视觉线索与反思,提升视觉语言模型的推理能力
计算机视觉与模式识别
2026-04-28 v1 人工智能
摘要
近期的视觉语言模型 (VLM) 进展受益于强化学习 (RL) 以实现更好的推理。然而,现有方法仍面临关键局限,包括缺乏低级视觉信息和有效的视觉反馈。为此,本文提出了统一的多模态交错推理框架 \textbf{ForeSight},使 VLM 能够通过低级视觉线索 \textbf{看得更远},并通过有效的视觉反馈 \textbf{深入思考}。首先,引入一组低级视觉工具,将关键视觉信息整合到推理链中,缓解对细粒度视觉特征的忽视。其次,构建基于掩码的视觉反馈机制,将视觉反思融入思考过程,使模型能够动态重新检查和更新答案。该框架受 RL 驱动,ForeSight 能自主决定工具调用和答案验证,最终答案的准确率作为奖励信号。为评估所提出框架的性能,我们构建了一个新数据集 Character and Grounding SalBench (CG-SalBench),基于 SalBench 数据集构建。实验结果表明,ForeSight-7B 模型在相同参数规模的模型中显著优于其他模型,甚至在某些指标上超越当前的 SOTA 闭源模型。
引用
@article{arxiv.2604.24339,
title = {See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection},
author = {Zhiheng Wu and Tong Wang and Shuning Wang and Naiming Liu and Yumeng Zhang},
journal= {arXiv preprint arXiv:2604.24339},
year = {2026}
}
备注
CVPR2026