基于级联潜在扩散模型的单颗卫星图像3D城市生成
计算机视觉与模式识别
2025-07-08 v1
摘要
近期生成模型的进展使人们能够从卫星影像中生成3D城市场景, unlocking 游戏、数字孪生等方面的潜在应用。然而,大多数现有方法依赖神经渲染技术,严重限制了其在更大范围内生成详细3D结构的能力,这主要源于2D观察相对有限带来的固有结构歧义。为解决这一挑战,我们提出Sat2City框架,融合稀疏体素网格的表征能力与潜在扩散模型,专为新构建的3D城市数据集而设计。我们的方法由三个关键组件驱动:(1) 级联潜在扩散框架,从卫星影像逐步恢复3D城市结构;(2) 在变分自编码器(VAE)瓶颈处引入Re-Hash操作,以计算多尺度特征网格,实现稳定的外观优化;(3) 逆采样策略,实现外观平滑过渡的隐式监督。为克服收集高质量几何与外观的真实城市规模3D模型的难题,我们构建了合成大规模3D城市数据集,配以卫星视角高度图。经该数据集验证,我们的框架可从单颗卫星图像生成详细3D结构,与现有城市生成模型相比,具备更高的保真度。
引用
@article{arxiv.2507.04408,
title = {A View-consistent Sampling Method for Regularized Training of Neural Radiance Fields},
author = {Aoxiang Fan and Corentin Dumery and Nicolas Talabot and Pascal Fua},
journal= {arXiv preprint arXiv:2507.04408},
year = {2025}
}
备注
ICCV 2025 accepted