通过生成式图像合成的自监督目标检测
计算机视觉与模式识别
2021-10-20 v1
摘要
我们提出 SSOD,首个用于自监督目标检测任务的基于可控 GAN 的端到端分析-合成框架。我们使用无边界框标注的真实世界图像集合来学习合成与检测目标。我们利用可控 GAN 合成具有预定义目标属性的图像,并用其训练目标检测器。我们提出合成网络与检测网络的紧密端到端耦合,以最优地训练我们的系统。最后,我们还提出一种无需目标数据标签即可将 SSOD 最优适配至预期目标数据的方法。在汽车检测任务上,于具有挑战性的 KITTI 与 Cityscapes 数据集,我们展示 SSOD 优于先前最先进的纯基于图像的自监督目标检测方法 Wetectron。即便无需任何 3D CAD 资源,它也超越了最先进的基于渲染的方法 Meta-Sim2。我们的工作通过引入一种利用基于可控 GAN 的图像合成的成功新范式并显著提升该任务的基线精度,推进了自监督目标检测领域。我们在 https://github.com/NVlabs/SSOD 开源代码。
引用
@article{arxiv.2110.09848,
title = {Self-Supervised Object Detection via Generative Image Synthesis},
author = {Siva Karthik Mustikovela and Shalini De Mello and Aayush Prakash and Umar Iqbal and Sifei Liu and Thu Nguyen-Phuoc and Carsten Rother and Jan Kautz},
journal= {arXiv preprint arXiv:2110.09848},
year = {2021}
}