SG-VAE:用于生成新室内场景的场景文法变分自编码器
计算机视觉与模式识别
2020-08-24 v2
摘要
近年来,深度生成模型已被用于学习连贯的潜在表示以合成高质量图像。在这项工作中,我们提出一种神经网络来学习用于采样一致室内场景布局的生成模型。我们的方法通过基于文法的自编码器学习不同物体类别的共现以及形状与位姿等外观参数,从而得到一种紧凑而精确的场景布局表示。与现有具有用户指定文法的基于文法的方法不同,我们通过从训练数据中推理物体共现提取一组产生式规则来自动构建文法。所提取的文法能够通过增广解析树表示一个场景。所提出的自编码器将这些解析树编码为潜在码,并将潜在码解码为解析树,从而确保生成的场景始终有效。我们通过实验证明,所提出的自编码器不仅学会生成有效场景(即物体的排布与外观),还学会了连贯的潜在表示,其中邻近的潜在样本解码为相似的场景输出。所获得的生成模型可应用于若干计算机视觉任务,例如从 RGB-D 数据进行的 3D 位姿与布局估计。
引用
@article{arxiv.1912.04554,
title = {SG-VAE: Scene Grammar Variational Autoencoder to generate new indoor scenes},
author = {Pulak Purkait and Christopher Zach and Ian Reid},
journal= {arXiv preprint arXiv:1912.04554},
year = {2020}
}