EdaDet:基于早期密集对齐的开词汇目标检测
计算机视觉与模式识别
2023-09-06 v1
摘要
CLIP 等视觉-语言模型提升了开词汇目标检测的性能,该类检测器在基类别上训练但需检测新类别。现有方法利用 CLIP 强大的零样本识别能力,将对象级嵌入与类别的文本嵌入对齐。然而,我们观察到,使用 CLIP 进行对象级对齐会导致对基类别的过拟合,即与基类别最为相似的新类别性能尤其差,因为它们被识别为相似的基类别。本文中,我们首先指出关键细粒度局部图像语义的丢失阻碍了现有方法获得强的基到新泛化能力。随后,我们提出早期密集对齐(EDA)以弥合可泛化局部语义与对象级预测之间的差距。在 EDA 中,我们利用对象级监督学习密集级而非对象级对齐,以保持局部细粒度语义。大量实验表明,在相同严格设置且不使用外部训练资源的情况下,我们的方法优于对比方法,即在 COCO 上提升 +8.4% 新类别框 AP50,在 LVIS 上提升 +3.9% 稀有掩码 AP。
引用
@article{arxiv.2309.01151,
title = {EdaDet: Open-Vocabulary Object Detection Using Early Dense Alignment},
author = {Cheng Shi and Sibei Yang},
journal= {arXiv preprint arXiv:2309.01151},
year = {2023}
}
备注
ICCV 2023; Project Page: https://chengshiest.github.io/edadet