以占据表征场景
计算机视觉与模式识别
2023-06-27 v3 机器人学
摘要
人类驾驶员可通过视觉系统轻松描述复杂的交通场景。这种精确感知能力对驾驶员的规划至关重要。为实现这一点,一种将物理 3D 场景量化为带逐单元语义标签的结构化栅格地图的几何感知表示,即 3D 占据(3D Occupancy),将是可取的。与边界框形式相比,占据背后的关键洞见是它能够捕捉场景中关键障碍物的细粒度细节,从而便利后续任务。先前或同期文献主要集中于单一场景补全任务,我们或可认为该占据表示的潜力可能有更广泛的影响。本文中,我们提出 OccNet,一种具有级联与时序体素解码器以重建 3D 占据的多视角视觉中心流水线。OccNet 的核心是用于表示 3D 物理世界的通用占据嵌入。此类描述符可应用于广泛的驾驶任务,包括检测、分割与规划。为验证这一新表示及我们所提算法的有效性,我们提出 OpenOcc,首个构建于 nuScenes 之上的稠密高质量 3D 占据基准。实证实验显示跨多个任务均有显著性能提升,例如运动规划碰撞率降低 15%-58%,展示了我们方法的优越性。
引用
@article{arxiv.2306.02851,
title = {Scene as Occupancy},
author = {Chonghao Sima and Wenwen Tong and Tai Wang and Li Chen and Silei Wu and Hanming Deng and Yi Gu and Lewei Lu and Ping Luo and Dahua Lin and Hongyang Li},
journal= {arXiv preprint arXiv:2306.02851},
year = {2023}
}
备注
Project link: https://github.com/OpenDriveLab/OccNet