UniOcc:以几何与语义渲染统一以视觉为中心的 3D 占据预测
计算机视觉与模式识别
2023-06-16 v1 人工智能
摘要
在本技术报告中,我们呈现了用于 CVPR 2023 nuScenes 开放数据集挑战赛中以视觉为中心的 3D 占据预测赛道的方案,命名为 UniOCC。现有占据预测方法主要聚焦于利用 3D 占据标签优化 3D 体素空间上的投影特征。然而,这些标签的生成过程复杂且昂贵(依赖 3D 语义标注),并受限于体素分辨率,无法提供细粒度空间语义。为克服该局限,我们提出一种新颖的统一占据(UniOcc)预测方法,通过体素光线渲染显式施加空间几何约束并补充细粒度语义监督。我们的方法显著增强模型性能,并展现出降低人工标注成本的良好潜力。鉴于 3D 占据标注的费力特性,我们进一步引入深度感知师生(DTS)框架,利用无标签数据提升预测精度。我们的方案在官方榜单上以单模型取得 51.27% mIoU,在本挑战赛中排名第 3。
引用
@article{arxiv.2306.09117,
title = {UniOcc: Unifying Vision-Centric 3D Occupancy Prediction with Geometric and Semantic Rendering},
author = {Mingjie Pan and Li Liu and Jiaming Liu and Peixiang Huang and Longlong Wang and Shanghang Zhang and Shaoqing Xu and Zhiyi Lai and Kuiyuan Yang},
journal= {arXiv preprint arXiv:2306.09117},
year = {2023}
}