中文

简单有效的室内三维场景合成

计算机视觉与模式识别 2022-12-02 v2 人工智能 机器学习

摘要

我们研究从一张或多张图像合成沉浸式室内三维场景的问题。我们的目标是能从新视角生成高分辨率图像与视频,包括外推远超输入图像的视角,同时保持三维一致性。现有方法高度复杂,包含许多分别训练的 stage 与组件。我们提出一种简单的替代方案:一个图像到图像的 GAN,直接从不完整点云的重投影映射到完整的高分辨率 RGB-D 图像。在 Matterport3D 和 RealEstate10K 数据集上,当由人类评估以及按 FID 分数评价时,我们的方法均显著优于先前工作。此外,我们表明我们的模型对生成式数据增强很有用。一个视觉与语言导航(VLN)智能体,使用由我们的模型进行空间扰动的轨迹训练,在 R2R 基准上相较最先进基线将成功率提升了高达 1.5%。我们的代码将公开,以促进生成式数据增强及下游机器人与具身 AI 任务的应用。

关键词

引用

@article{arxiv.2204.02960,
  title  = {Simple and Effective Synthesis of Indoor 3D Scenes},
  author = {Jing Yu Koh and Harsh Agrawal and Dhruv Batra and Richard Tucker and Austin Waters and Honglak Lee and Yinfei Yang and Jason Baldridge and Peter Anderson},
  journal= {arXiv preprint arXiv:2204.02960},
  year   = {2022}
}

备注

AAAI 2023