YOLOE:实时看见万物
计算机视觉与模式识别
2025-10-20 v2
摘要
目标检测与分割广泛应用于计算机视觉应用中,然而像 YOLO 系列这样的传统模型虽然高效且准确,却受限于预定义的类别,阻碍了其在开放场景中的适应性。近期的开放集方法利用文本提示、视觉线索或无提示范式来克服这一限制,但由于高计算需求或部署复杂性,往往在性能与效率之间进行妥协。在本工作中,我们引入了 YOLOE,它在单一的高效模型内集成了跨多种开放提示机制的检测与分割,实现了实时看见万物。对于文本提示,我们提出了可重参数化区域-文本对齐(RepRTA)策略。它通过一个可重参数化的轻量级辅助网络精炼预训练文本嵌入,并以零推理和迁移开销增强视觉-文本对齐。对于视觉提示,我们提出了语义激活视觉提示编码器(SAVPE)。它采用解耦的语义和激活分支,以最小的复杂性带来改进的视觉嵌入和准确率。对于无提示场景,我们引入了惰性区域-提示对比(LRPC)策略。它利用内置的大型词汇表和专门的嵌入来识别所有对象,避免了代价高昂的语言模型依赖。大量实验表明,YOLOE 具有出色的零样本性能和可迁移性,且推理效率高、训练成本低。值得注意的是,在 LVIS 上,以低 3 的训练成本和 1.4 的推理加速,YOLOE-v8-S 超过 YOLO-Worldv2-S 3.5 AP。在迁移至 COCO 时,YOLOE-v8-L 以近 4 更少的训练时间,比闭集 YOLOv8-L 获得了 0.6 AP 和 0.4 AP 的提升。代码和模型可在 https://github.com/THU-MIG/yoloe 获取。
引用
@article{arxiv.2503.07465,
title = {YOLOE: Real-Time Seeing Anything},
author = {Ao Wang and Lihao Liu and Hui Chen and Zijia Lin and Jungong Han and Guiguang Ding},
journal= {arXiv preprint arXiv:2503.07465},
year = {2025}
}
备注
ICCV 2025 Camera-ready Version