BlobGAN:空间解耦的场景表示
计算机视觉与模式识别
2022-08-02 v2
摘要
我们提出了一种用于场景生成模型的无监督中层表示。该表示之所以称为中层,是因为它既非逐像素也非逐图像;相反,场景被建模为一组具有空间位置、按深度排序的特征“blob(团块)”。Blob 被可微地放置到一个特征网格上,该网格由生成对抗网络解码为图像。由于 blob 的空间均匀性以及卷积固有的局部性,我们的网络学会将不同的 blob 与场景中的不同实体相关联,并排列这些 blob 以捕捉场景布局。我们通过以下方式展示这种涌现行为:尽管在没有任何监督的情况下训练,我们的方法仍支持诸如轻松操控场景内物体(例如移动、移除和重新风格化家具)、在给定约束下创建可行场景(例如在特定位置带有抽屉的合理房间),以及将真实世界图像解析为组成部件等应用。在一个具有挑战性的室内场景多类别数据集上,BlobGAN 在 FID 衡量的图像质量上优于 StyleGAN2。请访问我们的项目页面查看视频结果和交互式演示:https://www.dave.ml/blobgan
引用
@article{arxiv.2205.02837,
title = {BlobGAN: Spatially Disentangled Scene Representations},
author = {Dave Epstein and Taesung Park and Richard Zhang and Eli Shechtman and Alexei A. Efros},
journal= {arXiv preprint arXiv:2205.02837},
year = {2022}
}
备注
ECCV 2022. Project webpage available at https://www.dave.ml/blobgan