无监督单目3D占用预测的再评估
计算机视觉与模式识别
2026-02-09 v1
摘要
从单张图像推断3D结构——尤其是遮挡区域的结构——仍是视觉导向的自动驾驶中一个根本且未解决的挑战。现有的无监督方法通常训练神经辐射场,并在评估时将网络输出视为占用概率,忽略了训练和评估协议之间的不一致性。此外,普遍使用的2D ground truth未能揭示因几何约束不足导致的遮挡区域固有歧义。为此,本文提出了无监督单目3D占用预测的重新构建基准。我们首先解释体积渲染过程中涉及的变量,确定占用概率的最佳物理表示。基于这些分析,我们通过将新确定的表示与体素级别的3D占用 ground truth 对齐,改进了现有的评估协议,从而使无监督方法的评估方式与有监督方法一致。此外,为在遮挡区域施加显式约束,我们引入了一种遮挡感知的极化机制,利用多视角视觉线索来增强这些区域内占用空间与自由空间之间的判别能力。广泛的实验表明,我们的方法不仅显著超越了现有的无监督方法,还与有监督方法的性能相当。我们的源代码和评估协议将在发表后公开。
引用
@article{arxiv.2602.06488,
title = {Rebenchmarking Unsupervised Monocular 3D Occupancy Prediction},
author = {Zizhan Guo and Yi Feng and Mengtan Zhang and Haoran Zhang and Wei Ye and Rui Fan},
journal= {arXiv preprint arXiv:2602.06488},
year = {2026}
}