中文

GridCLIP:基于网格级CLIP表示学习的一阶段目标检测

计算机视觉与模式识别 2023-03-17 v1

摘要

在超大规模图文配对数据上预训练的视觉-语言基础模型,有潜力为下游视觉识别与检测任务提供可泛化的知识表示,尤其在补充下游模型训练中采样不足的类方面。近期利用 CLIP 进行目标检测的研究表明,两阶段检测器设计通常优于一阶段检测器,但需要更昂贵的训练资源与更长的推理时间。在本工作中,我们提出一阶段检测器 GridCLIP,缩小了其与两阶段检测器的性能差距,在训练和测试过程中分别比其两阶段对应方法(ViLD)快约 43 倍和 5 倍。GridCLIP 通过学习网格级表示来适应一阶段检测学习的内在原理,将传统的 CLIP 图像-文本整体映射扩展为更细粒度的网格-文本对齐。这不同于两阶段检测器中将区域视为图像直接应用 CLIP 的区域-文本映射。具体而言,GridCLIP 执行网格级对齐,通过对齐 CLIP 类别表示将 CLIP 图像级表示适配为网格级表示,以学习已标注(尤其是频繁的)类别。为学习更广泛类别(尤其是采样不足类别)的可泛化视觉表示,我们在训练时执行图像级对齐,将 CLIP 图像编码器中预学习的广泛类别从图像级传播到网格级表示。实验表明,所学的基于 CLIP 的网格级表示提升了采样不足(不频繁与新奇)类别的性能,在 LVIS 基准上达到可比的检测性能。

关键词

引用

@article{arxiv.2303.09252,
  title  = {GridCLIP: One-Stage Object Detection by Grid-Level CLIP Representation Learning},
  author = {Jiayi Lin and Shaogang Gong},
  journal= {arXiv preprint arXiv:2303.09252},
  year   = {2023}
}