中文

DeepEyes:通过强化学习激励“以图像思考”

计算机视觉与模式识别 2026-03-03 v3

摘要

大型视觉语言模型在多模态理解方面表现出色,但在将视觉信息深度集成到主要基于文本的推理过程方面存在挑战,这是镜像人类认知的关键问题。为此,我们引入了 DeepEyes,通过强化学习在端到端训练,使其学习“以图像思考”,无需为冷启动监督微调收集推理数据。值得注意的是,这一能力是天然产生的,利用模型自身的 grounding 能力作为内在函数,而不是依赖于外部专用模型或 API。我们通过主动感知实现了这一能力,其中模型学习在视觉信息上策略性地对其推理进行引导,通过量身定制的数据选择和奖励策略。DeepEyes 在一般感知和推理基准测试上实现了显著的性能提升,还在 grounding、幻觉和数学推理任务中表现出改进。有趣的是,我们观察到主动感知从初始探索到高效和准确的开发之间的distinct 演变,以及与人类视觉推理过程相似的多样化思考模式。代码可在 https://github.com/Visual-Agent/DeepEyes 获取。

关键词

引用

@article{arxiv.2505.14362,
  title  = {DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning},
  author = {Ziwei Zheng and Michael Yang and Jack Hong and Chenxiao Zhao and Guohai Xu and Le Yang and Chao Shen and Xing Yu},
  journal= {arXiv preprint arXiv:2505.14362},
  year   = {2026}
}

备注

Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random