面向3D场景理解的跨域合成到真实野外深度与法线估计
计算机视觉与模式识别
2024-06-10 v3 人工智能
机器学习
摘要
我们提出了一种跨域推断技术,该技术从合成数据中学习,以估计真实世界非受控环境中遇到的野外全向3D场景的深度和法线。为此,我们引入了UBotNet,一种结合UNet与Bottleneck Transformer元素的架构,用于预测一致的场景法线和深度。我们还引入了OmniHorizon合成数据集,包含24,335张代表广泛户外环境(包括建筑、街道和多样植被)的全向图像。该数据集由广阔的逼真虚拟空间生成,并包含动态场景元素,如变化的光照条件、一天中不同时间、行人和车辆。我们的实验表明,与现有模型相比,UBotNet在深度估计和法线估计上实现了显著更高的精度。最后,我们使用仅在我们的合成OmniHorizon数据集上训练的UBotNet,在真实户外图像上验证了跨域合成到真实的深度与法线估计,展示了该合成数据集与所提网络在真实世界场景理解应用中的潜力。
引用
@article{arxiv.2212.05040,
title = {Cross-Domain Synthetic-to-Real In-the-Wild Depth and Normal Estimation for 3D Scene Understanding},
author = {Jay Bhanushali and Manivannan Muniyandi and Praneeth Chakravarthula},
journal= {arXiv preprint arXiv:2212.05040},
year = {2024}
}
备注
Accepted to OmniCV 2024