中文

BlobGAN:空间解耦的场景表示

计算机视觉与模式识别 2022-08-02 v2

摘要

我们提出了一种用于场景生成模型的无监督中层表示。该表示之所以称为中层,是因为它既非逐像素也非逐图像;相反,场景被建模为一组具有空间位置、按深度排序的特征“blob(团块)”。Blob 被可微地放置到一个特征网格上,该网格由生成对抗网络解码为图像。由于 blob 的空间均匀性以及卷积固有的局部性,我们的网络学会将不同的 blob 与场景中的不同实体相关联,并排列这些 blob 以捕捉场景布局。我们通过以下方式展示这种涌现行为:尽管在没有任何监督的情况下训练,我们的方法仍支持诸如轻松操控场景内物体(例如移动、移除和重新风格化家具)、在给定约束下创建可行场景(例如在特定位置带有抽屉的合理房间),以及将真实世界图像解析为组成部件等应用。在一个具有挑战性的室内场景多类别数据集上,BlobGAN 在 FID 衡量的图像质量上优于 StyleGAN2。请访问我们的项目页面查看视频结果和交互式演示:https://www.dave.ml/blobgan

关键词

引用

@article{arxiv.2205.02837,
  title  = {BlobGAN: Spatially Disentangled Scene Representations},
  author = {Dave Epstein and Taesung Park and Richard Zhang and Eli Shechtman and Alexei A. Efros},
  journal= {arXiv preprint arXiv:2205.02837},
  year   = {2022}
}

备注

ECCV 2022. Project webpage available at https://www.dave.ml/blobgan