ViPOcc:利用视觉基础模型的视觉先验进行单视图三维占据预测
计算机视觉与模式识别
2025-01-13 v2
摘要
从单张图像推断场景的三维结构是视觉主导的自动驾驶领域中的一个不适定且具有挑战性的问题。现有方法通常采用神经辐射场来生成体素化的三维占据,缺乏实例级语义推理和时间光度一致性。在本文中,我们提出了 ViPOcc,它利用视觉基础模型(VFMs)的视觉先验进行精细的三维占据预测。与先前仅采用体积渲染进行 RGB 和深度图像重建的工作不同,我们引入了一个度量深度估计分支,其中提出了一种逆深度对齐模块,用于弥合 VFM 预测与真实值之间在深度分布上的领域差距。恢复的度量深度随后被用于时间光度对齐和空间几何对齐,以确保准确且一致的三维占据预测。此外,我们还提出了一种语义引导的非重叠高斯混合采样器,用于高效、实例感知的射线采样,解决了先前最先进方法中仍然存在的冗余和不平衡采样问题。大量实验证明了 ViPOcc 在 KITTI-360 和 KITTI Raw 数据集上在三维占据预测和深度估计任务中的优越性能。我们的代码可在以下网址获取:\url{https://mias.group/ViPOcc}。
引用
@article{arxiv.2412.11210,
title = {ViPOcc: Leveraging Visual Priors from Vision Foundation Models for Single-View 3D Occupancy Prediction},
author = {Yi Feng and Yu Han and Xijing Zhang and Tanghui Li and Yanting Zhang and Rui Fan},
journal= {arXiv preprint arXiv:2412.11210},
year = {2025}
}
备注
accepted to AAAI25