DINO-R1:激发视觉基础模型中的推理能力
计算机视觉与模式识别
2025-08-04 v2 人工智能
摘要
近期,人们对 DeepSeek-R1 等大型语言模型推理能力的爆发式兴趣,通过基于强化学习的微调框架(如 Group Relative Policy Optimization (GRPO) 等方法)展示了显著的成功。然而,这种推理能力在视觉基础模型(包括 DINO 系列等表示模型)中仍然未被充分探索且明显缺失。在本工作中,我们提出了 \textbf{DINO-R1},这是首次尝试使用强化学习来激发视觉基础模型的视觉上下文推理能力。具体而言,DINO-R1 引入了 \textbf{Group Relative Query Optimization (GRQO)},这是一种专门为基于查询的表示模型设计的新型强化式训练策略,该策略基于组归一化的对齐质量计算查询级别的奖励。我们还应用了 KL 正则化来稳定目标性分布,以减少训练的不稳定性。这种联合优化能够在各个查询之间实现密集且富有表现力的监督,同时缓解过拟合和分布漂移。基于 Grounding-DINO,我们训练了一系列 DINO-R1 家族模型,这些模型集成了视觉提示编码器和视觉引导的查询选择机制。在 COCO、LVIS 和 ODinW 上的广泛实验表明,DINO-R1 显著优于监督微调基线,在开放词表和闭集视觉提示场景中均实现了强大的泛化能力。
引用
@article{arxiv.2505.24025,
title = {DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models},
author = {Chenbin Pan and Wenbin He and Zhengzhong Tu and Liu Ren},
journal= {arXiv preprint arXiv:2505.24025},
year = {2025}
}