中文

面向 DETR 的语言感知多数据集检测预训练

计算机视觉与模式识别 2023-04-10 v1

摘要

在大规模数据集上进行预训练可以提升目标检测器的性能,然而由于标注成本高昂,用于目标检测的有标注数据集难以扩展。我们所拥有的是大量孤立的特定领域数据集,因此,跨数据集聚合联合预训练模型以增强数据量与多样性颇具吸引力。本文提出一个利用多数据集预训练类 DETR 检测器的强框架,称为 METR,无需人工整合标签空间。该方法通过引入预训练语言模型,将目标检测中典型的多分类转化为二分类。具体而言,我们设计了一个类别提取模块,用于提取图像中涉及的潜在类别,并通过语言嵌入将这些类别分配给不同的查询。每个查询仅负责预测特定类别的物体。此外,为适配我们新颖的检测范式,我们提出一种分组二分匹配策略,将真值限制为仅与分配给同一类别的查询匹配。大量实验表明,METR 在多任务联合训练或预训练-微调范式下均取得了优异结果。值得注意的是,我们的预训练模型具有高度灵活的迁移性,并在 COCO val2017 基准上提升了多种类 DETR 检测器的性能。代码将在本文发表后公开。

关键词

引用

@article{arxiv.2304.03580,
  title  = {Language-aware Multiple Datasets Detection Pretraining for DETRs},
  author = {Jing Hao and Song Chen and Xiaodi Wang and Shumin Han},
  journal= {arXiv preprint arXiv:2304.03580},
  year   = {2023}
}