实时检测任意对象:从单提示分割到多类检测
计算机视觉与模式识别
2026-03-13 v1
摘要
近期的视觉语言建模进展推出了可接受推理时任意自然语言查询的可提示检测与分割系统,其中 SAM3 通过结合 ViT-H/14 backbone 以及跨模态变换解码和学习对象查询,实现了最先进的准确率。然而,SAM3 在每次前向传播中仅处理单个文本提示。检测 N 个类别需要 N 次独立执行,每次执行都由 4.39 亿参数的 backbone 主导。我们提出 Detect Anything in Real Time (DART),一个无训练框架,将 SAM3 转换为实时多类检测器,方法是利用一种结构不变性:视觉 backbone 是类别无关的,产生的图像特征独立于文本提示。这使得所有类别之间可以共享 backbone 计算,将其成本从 O(N) 降低到 O(1)。结合批量多类解码、检测-only 推理以及 TensorRT FP16 部署,这些优化措施在 3 类情况下实现 5.6 倍累计加速,扩展到 80 类时可达 25 倍,仅通过不修改任何模型权重即可实现。在 COCO val2017(5,000 张图像,80 类)上,DART 在单张 RTX 4080 上以 15.8 FPS 的速度实现 55.8 AP(4 类,1008x1008),超越了在数百万框标注上训练的专用开放词汇检测器。对于极端延迟目标,采用冻结 encoder-decoder 的适配器蒸馏,可实现 38.7 AP 和 13.9 毫秒的 backbone 延迟。代码和模型均可在 https://github.com/mkturkcan/DART 获取。
引用
@article{arxiv.2603.11441,
title = {Detect Anything in Real Time: From Single-Prompt Segmentation to Multi-Class Detection},
author = {Mehmet Kerem Turkcan},
journal= {arXiv preprint arXiv:2603.11441},
year = {2026}
}