中文

UrbanCraft: 基于层次化语义-几何先验的城市视图外推

计算机视觉与模式识别 2025-05-30 v1

摘要

现有的基于神经渲染的城市场景重建方法主要关注插值视图合成(IVS)设置,即从靠近训练相机轨迹的视角进行合成。然而,IVS 无法保证在训练相机分布之外的新视角(例如向左、向右或向下看)上取得同等性能,这限制了城市重建应用的泛化能力。先前的方法通过图像扩散优化了这一问题,但由于纯文本扩散的粗粒度控制,它们无法处理文本歧义或大范围未见视角。在本文中,我们设计了 UrbanCraft,它利用层次化语义-几何表示作为额外先验,克服了外推视图合成(EVS)问题。具体而言,我们利用部分可观测场景重建粗略的语义和几何基元,通过占据网格作为基础表示建立粗略的场景级先验。此外,我们引入来自 3D 边界框的精细实例级先验,以增强对象级细节和空间关系。在此基础上,我们提出了层次化语义-几何引导的变分分数蒸馏(HSG-VSD),将来自预训练 UrbanCraft2D 的语义和几何约束集成到分数蒸馏采样过程中,迫使分布与可观测场景保持一致。定性和定量比较证明了我们的方法在 EVS 问题上的有效性。

关键词

引用

@article{arxiv.2505.23434,
  title  = {UrbanCraft: Urban View Extrapolation via Hierarchical Sem-Geometric Priors},
  author = {Tianhang Wang and Fan Lu and Sanqing Qu and Guo Yu and Shihang Du and Ya Wu and Yuan Huang and Guang Chen},
  journal= {arXiv preprint arXiv:2505.23434},
  year   = {2025}
}