YOLO-UniOW:高效通用开放世界目标检测
计算机视觉与模式识别
2024-12-31 v1
摘要
传统目标检测模型受限于封闭数据集的限制,只能检测训练期间遇到的类别。虽然多模态模型通过对齐文本和图像模态已扩展了类别识别,但引入了显著的推理开销 due to 跨模态融合,仍受限于预定义词汇,无法有效处理开放世界情景中的未知对象。本文我们引入了通用开放世界目标检测(Uni-OWD),一种统一开放词汇和开放世界目标检测任务的新范式。为解决此设置的挑战,我们提出了 YOLO-UniOW,一种 advances 效率、 versatility 和 performance 的新型模型。YOLO-UniOW 采用自适应决策学习以替代计算密集的跨模态融合,在 CLIP 潜在空间中实现轻量级对齐,实现高效检测而不牺牲泛化能力。此外,我们设计了通配符学习策略,能够将分布之外的对象检测为“未知”,同时实现无需增量学习的动态词汇扩展。该设计使 YOLO-UniOW 能够无缝适应开放世界环境中的新类别。广泛的实验验证表明,YOLO-UniOW 在 LVIS 上实现了 34.6 AP 和 30.0 APr,推理速度达 69.6 FPS。该模型在 M-OWODB、S-OWODB 和 nuScenes 数据集上设立了基准,展示了在开放世界目标检测中的卓越性能。代码和模型可在 https://github.com/THU-MIG/YOLO-UniOW 获取。
引用
@article{arxiv.2412.20645,
title = {YOLO-UniOW: Efficient Universal Open-World Object Detection},
author = {Lihao Liu and Juexiao Feng and Hui Chen and Ao Wang and Lin Song and Jungong Han and Guiguang Ding},
journal= {arXiv preprint arXiv:2412.20645},
year = {2024}
}