AerialMegaDepth:学习空中-地面重建与视图合成
计算机视觉与模式识别
2025-04-18 v1
摘要
我们探讨了从混合空中与地面视角捕获的图像进行几何重建的任务。当前基于学习的方法难以处理空中-地面图像对之间的极端视点变化。我们的假设是,缺乏用于训练的高质量、共配准的空中-地面数据集是导致此失败的关键原因。这种数据难以大规模重建。为克服这一挑战,我们提出了一种可扩展框架,将来自3D城市网格(如Google Earth)的伪合成渲染与来自真实、地面级众包图像(如MegaDepth)相结合。伪合成数据模拟了广泛的空中视点,而真实众包图像有助于提高地面级图像的视觉保真度,因为基于网格的渲染在细节上不足。这种方法有效地弥合了真实图像与伪合成渲染之间的领域差距。在使用混合数据集微调后,我们对多个基于学习的方法实现了显著提升。例如,我们观察到基线DUSt3R在5°的相机旋转误差内本地化不到5%的空中-地面对,而使用我们的数据将准确率提高到接近56%,解决了处理大规模视点变化的主要瓶颈。除了相机估计和场景重建,我们的dataset还能提高下游任务(如在挑战性的空中-地面情景下的新视角合成)的性能,展示了在实际应用中本方法的实用价值。
引用
@article{arxiv.2504.13157,
title = {AerialMegaDepth: Learning Aerial-Ground Reconstruction and View Synthesis},
author = {Khiem Vuong and Anurag Ghosh and Deva Ramanan and Srinivasa Narasimhan and Shubham Tulsiani},
journal= {arXiv preprint arXiv:2504.13157},
year = {2025}
}
备注
Appearing in CVPR 2025. Project page: https://aerial-megadepth.github.io