中文

YOLO-Master:基于专业 Transformer 的 MoE 加速实现实时检测

计算机视觉与模式识别 2026-01-01 v2

摘要

现有的实时目标检测 (RTOD) 方法通常采用 YOLO 类架构,以获得准确率和速度之间的良好平衡。然而,这些模型依赖于静态稠密计算,对所有输入应用统一的处理,导致在资源分配上出现不合理的分配——在简单场景中过度分配,在复杂场景中不足。这种匹配不一致导致计算冗余和次优检测性能。为克服这一限制,我们提出了 YOLO-Master,一种新的 YOLO 类框架,引入了针对每个输入的实例条件自适应计算,以实现 RTOD。我们通过一种 Efficient 稀疏 Mixture-of-Experts (ES-MoE) 模块动态地将计算资源分配给每个输入,依据其场景复杂度。其核心是一个轻量级动态路由网络,通过一种增强多样性的目标函数引导专家在训练期间的专业化,鼓励专家之间拥有互补的专业知识。此外,路由网络会自适应地学习仅激活最相关的专家,从而在推理期间提高检测性能的同时最小化计算开销。我们在五个大型基准数据集上进行了全面实验,证明了 YOLO-Master 的优越性。在 MS COCO 上,本模型实现了 42.4% 的 AP,延迟仅 1.62ms,超越 YOLOv13-N 增加 0.8% 的 mAP,推理速度快 17.8%。值得注意的是,在具有挑战性的稠密场景中, gains 最为显著,而该模型在典型输入上保持效率,同时保持实时推理速度。代码将公开。

关键词

引用

@article{arxiv.2512.23273,
  title  = {YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection},
  author = {Xu Lin and Jinlong Peng and Zhenye Gan and Jiawen Zhu and Jun Liu},
  journal= {arXiv preprint arXiv:2512.23273},
  year   = {2026}
}