中文

InstaGen: 通过在合成数据集上训练增强目标检测

计算机视觉与模式识别 2024-04-09 v3

摘要

本文提出了一种新范式,通过在由扩散模型生成的合成数据集上进行训练,来增强目标检测器的能力,例如扩展类别或提升检测性能。具体而言,我们将一个实例级定位头集成到预训练的生成式扩散模型中,以增强其在生成图像中定位实例的能力。该定位头被训练以将类别名称的文本嵌入与扩散模型的区域视觉特征对齐,使用现成目标检测器的监督,以及在检测器未覆盖的(新)类别上的新型自训练方案。我们进行了详尽的实验以表明,这种增强版的扩散模型(称为 InstaGen)可以作为数据合成器,通过在其生成的样本上进行训练来增强目标检测器,在开放词汇(+4.5 AP)和数据稀疏(+1.2 至 5.2 AP)场景中展现出优于现有 SOTA 方法的性能。项目页面与代码:https://fcjian.github.io/InstaGen。

关键词

引用

@article{arxiv.2402.05937,
  title  = {InstaGen: Enhancing Object Detection by Training on Synthetic Dataset},
  author = {Chengjian Feng and Yujie Zhong and Zequn Jie and Weidi Xie and Lin Ma},
  journal= {arXiv preprint arXiv:2402.05937},
  year   = {2024}
}

备注

CVPR2024