中文

ImaginaryNet:无需真实图像与标注学习目标检测器

计算机视觉与模式识别 2022-10-14 v1

摘要

无需在现实中训练,人类即可仅基于语言描述轻松检测已知概念。赋予深度学习此种能力无疑能使神经网络处理复杂的视觉任务,例如目标检测,而无需收集和标注真实图像。为此,本文引入一种新颖且具挑战性的学习范式——想象监督目标检测(ISOD),其中训练目标检测器既不允许使用真实图像也不允许使用人工标注。为应对该挑战,我们提出 ImaginaryNet,一种通过结合预训练语言模型与文本到图像合成模型来合成图像的框架。给定一个类别标签,语言模型用于生成包含目标物体的场景的完整描述,文本到图像模型则生成照片级真实感图像。利用合成图像与类别标签,便可借助弱监督目标检测来完成 ISOD。通过逐步引入真实图像与人工标注,ImaginaryNet 可与其他监督设定协作以进一步提升检测性能。实验表明,ImaginaryNet 能够(i)在 ISOD 中取得约 70% 的、相对于在相同主干网络上于真实数据训练的弱监督对应方法的性能;(ii)在将 ImaginaryNet 与其他监督设定结合时显著提升基线,同时取得最先进或可比的性能。

关键词

引用

@article{arxiv.2210.06886,
  title  = {ImaginaryNet: Learning Object Detectors without Real Images and Annotations},
  author = {Minheng Ni and Zitong Huang and Kailai Feng and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2210.06886},
  year   = {2022}
}

备注

12 pages, 6 figures