中文

Pano3DComposer:从单全景图像生成可调和的 3D 场景

计算机视觉与模式识别 2026-03-09 v1

摘要

当前的构式图像到 3D 场景生成方法通过耗时的迭代布局优化或僵化的联合物体-布局生成来构建 3D 场景。且大多数方法依赖有限视野的透视图像,限制了对完整 360° 环境的创建。为此,我们设计 Pano3DComposer,一个针对全景图像的高效前馈框架。为将物体生成与布局估计解耦,我们提出了即插即用的对象-世界转换预测器。该模块将由 off-the-shelf 图像到 3D 模型生成的局部坐标下的 3D 物体转换为世界坐标。为实现这一目标,我们改进 VGGT 架构,通过目标物体裁剪、多视角物体渲染和相机参数来预测转换。该预测器使用伪几何监督进行训练,以解决生成物体与真实物体之间的形状差异。对于来自未见域的输入图像,我们进一步引入粗到细(C2F)对齐机制,以反馈场景渲染迭代细化几何一致性。我们的方法在合成数据和真实世界数据集上实现了优异的几何精度。它可在约 20 秒内生成高保真度的 3D 场景。项目页面:https://qiuzidian.github.io/pano3dcomposer-page/。

关键词

引用

@article{arxiv.2603.05908,
  title  = {Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image},
  author = {Zidian Qiu and Ancong Wu},
  journal= {arXiv preprint arXiv:2603.05908},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Project page: https://qiuzidian.github.io/pano3dcomposer-page/