ProxyDet:通过逐类 Mixup 合成代理新类以实现开放词汇目标检测
计算机视觉与模式识别
2024-02-22 v4
摘要
开放词汇目标检测 (OVOD) 旨在识别训练集中未包含其类别的新颖目标。为了在训练期间对这些未见类别进行分类,许多 OVOD 框架利用了经过大规模预训练的视觉与语言模型(如 CLIP)的零样本能力。为了进一步提高对未见新类的泛化能力,已有几种方法提出在包含大量超出当前训练数据的新类别标签的外部数据源上,通过伪区域标注进行额外训练。尽管该方法简单,但对于未被伪标注的真正未见新类,这些伪标注方法仍表现出有限的提升。在本文中,我们提出了一种新颖而简单的技术,有助于在新类整体分布上的泛化。受我们观察到的启发——在 CLIP 嵌入空间中,众多新类位于由基类(已见类)构成的凸包内——我们提出通过一对基类之间的线性 mixup 来合成近似新类的代理新类。通过使用这些合成的代理新类训练我们的检测器,我们有效地探索了新类的嵌入空间。在 LVIS 和 COCO 等各种 OVOD 基准上的实验结果表明,与其他最先进的方法相比,本文方法在新类上取得了更优的性能。代码可在 https://github.com/clovaai/ProxyDet 获取。
引用
@article{arxiv.2312.07266,
title = {ProxyDet: Synthesizing Proxy Novel Classes via Classwise Mixup for Open-Vocabulary Object Detection},
author = {Joonhyun Jeong and Geondo Park and Jayeon Yoo and Hyungsik Jung and Heesu Kim},
journal= {arXiv preprint arXiv:2312.07266},
year = {2024}
}
备注
Accepted in AAAI24. Code: https://github.com/clovaai/ProxyDet Project page: https://proxydet.github.io