VPOcc: 利用消失点进行 3D 语义占据预测
计算机视觉与模式识别
2025-08-15 v2 机器人学
摘要
理解 3D 场景的语义和空间信息对于机器人和自动驾驶车辆的安全导航至关重要,有助于障碍规避和准确轨迹规划。相机-based 的 3D 语义占据预测技术因其相较于 3D 传感器更具资源效率而在机器人视觉领域日益受到关注。然而,该任务本质上存在 2D-3D 差距,即同一尺寸的物体在 3D 空间中,由于透视投影,在 2D 图像中呈现出不同尺度。为解决此问题,我们提出一种新型框架 VPOcc,利用消失点(VP)在像素级和特征级缓解 2D-3D 差距。作为像素级解决方案,我们引入 VPZoomer 模块,通过基于消失点的仿射变换对图像进行扭曲,以抵消透视效应。此外,作为特征级解决方案,我们提出 VP-guided 跨注意力(VPCA)模块,执行透视感知特征聚合,利用更适用于 3D 空间的 2D 图像特征。最后,我们将来自原始和扭曲后图像提取的两个特征体积集成,通过空间体积融合(SVF)模块进行相互补偿。通过有效地将 VP 融入网络,本框架在 SemanticKITTI 和 SSCBench-KITTI360 数据集上在 IoU 和 mIoU 指标上均取得了改进。更多细节请参见 https://vision3d-lab.github.io/vpocc/。
引用
@article{arxiv.2408.03551,
title = {VPOcc: Exploiting Vanishing Point for 3D Semantic Occupancy Prediction},
author = {Junsu Kim and Junhee Lee and Ukcheol Shin and Jean Oh and Kyungdon Joo},
journal= {arXiv preprint arXiv:2408.03551},
year = {2025}
}