中文

面向城市场景的实用主义语义图像合成

计算机视觉与模式识别 2023-05-18 v1

摘要

在扩展自动驾驶 AI 算法时,对大量训练与验证数据的需求是一个巨大关切。语义图像合成(SIS),或称标签到图像翻译,有望通过将语义布局翻译为图像来解决此问题,提供可控的真实感数据生成。然而,它们需要大量配对数据,带来额外成本。在本工作中,我们提出一项新任务:给定一个含合成图像与标签的数据集和一个含无标签真实图像的数据集,我们的目标是学习一个模型,能够生成具有输入掩码内容与真实图像外观的图像。这一新任务将众所周知的的无监督 SIS 任务重构为更实际的设定,其中我们利用驾驶模拟器中廉价可用的合成数据来学习生成城市场景的真实感图像。这与先前工作形成对比,后者假设标签与图像来自同一域但在训练期间未配对。我们发现先前的无监督工作在此任务上表现不佳,因为它们未处理两个不同域之间的分布偏移。为绕过这些问题,我们提出一个具有两个主要贡献的新框架。首先,我们利用合成图像作为生成图像内容的引导,通过在块级别惩罚其高层特征之间的差异。其次,与先前采用单一判别器过拟合目标域语义分布的工作不同,我们对整幅图像采用一个判别器,并对图像块采用多尺度判别器。在基准 GTA-V \rightarrow Cityscapes 与 GTA-V \rightarrow Mapillary 上的大量比较显示了所提模型在此任务上相对于 SOTA 的优越性能。

关键词

引用

@article{arxiv.2305.09726,
  title  = {Towards Pragmatic Semantic Image Synthesis for Urban Scenes},
  author = {George Eskandar and Diandian Guo and Karim Guirguis and Bin Yang},
  journal= {arXiv preprint arXiv:2305.09726},
  year   = {2023}
}