VisionReasoner:基于强化学习的统一推理集成视觉感知
计算机视觉与模式识别
2026-02-10 v5
摘要
大型视觉语言模型已显示出处理多样化视觉感知任务的内在能力。本文引入 VisionReasoner,一个统一框架,能够在共享模型中进行推理并解决多种视觉感知任务。具体而言,通过设计统一的奖励机制和多对象认知学习策略,VisionReasoner 增强了其推理能力,以分析视觉输入,并在统一模型中解决多样化感知任务。VisionReasoner 在向用户提出查询前生成结构化的推理过程。人类评估表明,VisionReasoner 的推理过程即使没有标注推理训练数据也能忠实可靠。为严格评估统一视觉感知能力,我们在检测、分割和计数三个关键领域的十个任务上对 VisionReasoner 进行评估。实验结果表明,VisionReasoner 作为统一模型实现了优异性能,相较于基线 Qwen2.5VL,在 COCO(检测)上提升 29.1%,在 ReasonSeg(分割)上提升 22.1%,在 CountBench(计数)上提升 13.2%。
引用
@article{arxiv.2505.12081,
title = {VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning},
author = {Yuqi Liu and Tianyuan Qu and Zhisheng Zhong and Bohao Peng and Shu Liu and Bei Yu and Jiaya Jia},
journal= {arXiv preprint arXiv:2505.12081},
year = {2026}
}