扩展开放词汇目标检测的规模
计算机视觉与模式识别
2024-05-24 v3
摘要
开放词汇目标检测已从预训练视觉-语言模型中极大受益,但仍受限于可用检测训练数据的数量。虽然通过使用网络图像-文本对作为弱监督可扩展检测训练数据,但此前未在与图像级预训练可比的规模上开展。在此,我们通过自训练扩展检测数据,即使用现有检测器在图像-文本对上生成伪框标注。扩展自训练的主要挑战在于标签空间的选择、伪标注过滤和训练效率。我们提出OWLv2模型与OWL-ST自训练方案,以应对这些挑战。OWLv2在可比训练规模(约1000万样本)下已超越先前最先进开放词汇检测器的性能。然而,借助OWL-ST,我们可扩展至超过10亿样本,带来进一步大幅提升:采用L/14架构,OWL-ST将LVIS稀有类(模型未见过任何人标框标注)的AP从31.2%提升至44.6%(相对提升43%)。OWL-ST为开放世界定位解锁了网络规模训练,类似于图像分类与语言建模中所见。
引用
@article{arxiv.2306.09683,
title = {Scaling Open-Vocabulary Object Detection},
author = {Matthias Minderer and Alexey Gritsenko and Neil Houlsby},
journal= {arXiv preprint arXiv:2306.09683},
year = {2024}
}