驯服自训练以用于开放词汇目标检测
计算机视觉与模式识别
2024-04-16 v3
摘要
近期研究表明,利用来自预训练视觉与语言模型(VLMs)的伪标签(PLs)在开放词汇目标检测(OVD)中取得了有前景的性能。然而,师生自训练这一强大且被广泛使用的利用 PLs 的范式却很少在 OVD 中被探索。本工作识别出在 OVD 中使用自训练的两个挑战:来自 VLM 的含噪 PLs 以及 PLs 频繁的分布式变化。为应对这些挑战,我们提出 SAS-Det,从两个关键视角驯服用于 OVD 的自训练。首先,我们提出一种拆分-融合(SAF)检测头,将标准检测拆分为开放分支与封闭分支。该设计可减少来自伪边界框的含噪监督。此外,两分支从不同的训练数据中学习互补知识,融合后显著提升性能。其次,我们认为不同于封闭集任务,OVD 中的 PL 分布仅由教师模型决定。我们引入周期性更新策略以减少教师更新次数,从而降低 PL 分布变化频率,稳定训练过程。大量实验表明 SAS-Det 既高效又有效。SAS-Det 以明显优势超越同规模近期模型,并在 COCO 与 LVIS 基准的新类别上分别取得 37.4 AP50 与 29.1 APr。代码见 \url{https://github.com/xiaofeng94/SAS-Det}。
引用
@article{arxiv.2308.06412,
title = {Taming Self-Training for Open-Vocabulary Object Detection},
author = {Shiyu Zhao and Samuel Schulter and Long Zhao and Zhixing Zhang and Vijay Kumar B. G and Yumin Suh and Manmohan Chandraker and Dimitris N. Metaxas},
journal= {arXiv preprint arXiv:2308.06412},
year = {2024}
}
备注
Accepted to CVPR 2024. The supplementary document included