中文

用于检测的 DALL-E:语言驱动的组合式图像合成用于目标检测

计算机视觉与模式识别 2022-12-23 v3

摘要

我们提出了一种新范式,利用文本到图像合成框架(例如 DALL-E、Stable Diffusion 等)自动大规模生成带有准确标签的训练数据。所提出的方法将训练数据生成解耦为前景目标掩码生成和背景(上下文)图像生成。对于前景目标掩码生成,我们使用一个带有目标类别名称的简单文本模板作为 DALL-E 的输入,以生成多样化的前景图像集。然后使用前景-背景分割算法生成前景目标掩码。接下来,为了生成上下文图像,首先通过对一小部分代表上下文的图像应用图像描述方法,生成上下文的语言描述。然后使用这些语言描述,通过 DALL-E 框架生成多样化的上下文图像集。这些图像随后与第一步中生成的目标掩码合成,为分类器提供增强的训练集。我们在四个目标检测数据集上展示了我们方法的优势,包括 Pascal VOC 和 COCO 目标检测任务。此外,我们还强调了我们的数据生成方法在分布外和零样本数据生成场景中的组合特性。

关键词

引用

@article{arxiv.2206.09592,
  title  = {DALL-E for Detection: Language-driven Compositional Image Synthesis for Object Detection},
  author = {Yunhao Ge and Jiashu Xu and Brian Nlong Zhao and Neel Joshi and Laurent Itti and Vibhav Vineet},
  journal= {arXiv preprint arXiv:2206.09592},
  year   = {2022}
}

备注

v3(same as v2) version, update structure (add foreground generation, stable diffusion), add more experiments