Halluci-Net:利用物体共现关系进行场景补全
计算机视觉与模式识别
2021-05-24 v2 机器学习
摘要
近年来,从语义标签图合成图像取得了实质性进展。然而,用于此任务的方法假设可以获得完整且无歧义的标签图,其中包含物体的实例边界以及每个像素的类别标签。这种对大量标注输入的依赖限制了图像合成技术在现实世界中的应用,尤其是在天气、遮挡或噪声导致的不确定性下。另一方面,能够从稀疏标签图或草图合成图像的算法,作为能够指导内容创作者和艺术家通过简单指定少数物体位置来快速生成场景的工具,是非常理想的。在本文中,我们解决了从稀疏标签图补全复杂场景的问题。在此设定下,只有极少的场景细节(30%的物体实例)可作为图像合成的输入。我们提出了一种基于两阶段深度网络的方法,称为“Halluci-Net”,该方法学习场景中物体之间的共现关系,然后利用这些关系生成密集且完整的标签图。生成的密集标签图随后可作为最先进的图像合成技术(如pix2pixHD)的输入,以获得最终图像。所提出的方法在Cityscapes数据集上进行了评估,在Fréchet Inception Distance(FID)、语义分割精度和物体共现相似性等性能指标上,均优于两种基线方法。我们还展示了在包含卧室图像的ADE20K数据集子集上的定性结果。
引用
@article{arxiv.2004.08614,
title = {Halluci-Net: Scene Completion by Exploiting Object Co-occurrence Relationships},
author = {Kuldeep Kulkarni and Tejas Gokhale and Rajhans Singh and Pavan Turaga and Aswin Sankaranarayanan},
journal= {arXiv preprint arXiv:2004.08614},
year = {2021}
}
备注
Accepted to AI for Content Creation Workshop @CVPR 2021