LPA3D:从户外图像生成 3D 房间级场景
计算机视觉与模式识别
2025-04-04 v1
摘要
从户外图像生成具有语义可信度和细节丰富性的房间级室内场景对于 VR、AR 和机器人等应用至关重要。NeRF 基于的生成方法的成功表明,这一挑战有一个可行的方向。然而,与其在对象层面取得成功不同,现有的场景级生成方法需要额外信息(如多个视角、深度图像或语义指导),而不能仅依赖 RGB 图像。这是因为 NeRF 基于的方法需要相机姿态的先验知识,而对于室内场景而言,这在定义对齐方式和从单张图像全局估计姿态(鉴于摄像机后方不可见部分)方面具有挑战性。为此,我们在 Local-Pose-Alignment(LPA)框架内重新定义全局姿态——一种基于锚点的多局部坐标系,其使用所选锚点作为这些坐标的根。基于此基础,我们引入 LPA-GAN,一种新颖的 NeRF 基于的生成方法,包含特定修改以估计 LPA 下的相机姿态先验。它还联合优化姿态预测和场景生成过程。我们的消融研究与与 NeRF 基于对象生成方法的直接扩展进行比较,证明了我们方法的有效性。此外,与其他技术的视觉比较表明,我们的方法在视角间一致性和语义正常性方面取得了优势。
引用
@article{arxiv.2504.02337,
title = {LPA3D: 3D Room-Level Scene Generation from In-the-Wild Images},
author = {Ming-Jia Yang and Yu-Xiao Guo and Yang Liu and Bin Zhou and Xin Tong},
journal= {arXiv preprint arXiv:2504.02337},
year = {2025}
}