中文

DIP-R1: 基于强化学习的深度检查与感知,透视并理解复杂场景

计算机视觉与模式识别 2025-10-16 v2

摘要

多模态大语言模型(MLLMs)已展现出显著的视觉理解能力,但其在拥挤公共场所等复杂真实场景中的细粒度视觉感知能力仍然有限。受近期强化学习(RL)在 LLMs 和 MLLMs 中取得成功的启发,本文探索 RL 如何增强 MLLMs 的视觉感知能力。随后,我们开发了一种新颖的基于 RL 的框架——基于 RL 的深度检查与感知(DIP-R1),旨在通过理解复杂场景并仔细透视视觉实例来增强 MLLMs 的视觉感知能力。DIP-R1 通过三种设计简单的基于规则的奖励建模来指导 MLLMs 对视觉场景进行详细检查。首先,我们采用标准推理奖励,鼓励模型包含三步推理过程:1)理解整个视觉场景,2)观察以透视感兴趣但模糊的区域,3)决策以预测答案。其次,设计了方差引导的观察奖励,以鼓励 MLLM 在观察过程中检查不确定区域,引导其检查模糊区域并减轻感知不确定性。该奖励促进了方差驱动的视觉探索,使 MLLM 能够对区域级不确定性进行推理,并明确指出可解释的不确定区域。第三,我们建模了加权精确率-召回率准确率奖励,以增强准确的决策。我们在由拥挤场景等具有挑战性的真实场景组成的多种细粒度目标检测数据上验证了其有效性。基于现有的 MLLMs,DIP-R1 在各种领域内和领域外场景中均取得了一致且显著的提升,优于各种现有基线和 SFT 方法。我们的发现突出了将 RL 集成到 MLLMs 中以增强复杂真实世界感知任务能力的巨大潜力。

关键词

引用

@article{arxiv.2505.23179,
  title  = {DIP-R1: Deep Inspection and Perception with RL Looking Through and Understanding Complex Scenes},
  author = {Sungjune Park and Hyunjun Kim and Junho Kim and Seongho Kim and Yong Man Ro},
  journal= {arXiv preprint arXiv:2505.23179},
  year   = {2025}
}