Dynamic-DINO:面向实时开放词汇目标检测的细粒度专家混合微调
计算机视觉与模式识别
2025-07-24 v1
摘要
专家混合 (MoE) 架构在大型视觉语言模型 (LVLM) 中表现出色,但其在实时开放词汇目标检测器中的潜力尚未被探索,这些检测器也利用大规模视觉语言数据集,但模型更小。本文研究了这一领域,揭示了有趣的见解。在浅层中,专家倾向于与多样化的同伴合作以扩展搜索空间。而在深层中,出现了固定的协作结构,每个专家维持 2-3 个固定伙伴,不同的专家组合专门处理特定的模式。具体来说,我们提出了 Dynamic-DINO,它通过一种高效的 MoE-Tuning 策略,将 Grounding DINO 1.5 Edge 从密集模型扩展为动态推理框架。此外,我们设计了一种粒度分解机制,将基础模型的前馈网络 (FFN) 分解为多个更小的专家网络,从而扩展子网搜索空间。为了防止微调开始时性能下降,我们进一步提出了一种针对专家的预训练权重分配策略,并结合特定的路由器初始化。在推理过程中,仅激活与输入相关的专家以形成紧凑的子网。实验表明,仅使用 156 万开源数据进行预训练,Dynamic-DINO 的性能就优于在私有 Grounding20M 数据集上预训练的 Grounding DINO 1.5 Edge。
引用
@article{arxiv.2507.17436,
title = {Dynamic-DINO: Fine-Grained Mixture of Experts Tuning for Real-time Open-Vocabulary Object Detection},
author = {Yehao Lu and Minghe Weng and Zekang Xiao and Rui Jiang and Wei Su and Guangcong Zheng and Ping Lu and Xi Li},
journal= {arXiv preprint arXiv:2507.17436},
year = {2025}
}
备注
Accepted by ICCV 2025