ApolloCar3D:面向自动驾驶的大规模三维车辆实例理解基准
计算机视觉与模式识别
2018-12-03 v2
摘要
自动驾驶已引起工业界与学术界的显著关注。一项重要任务是估计道路上行驶或停放车辆的三维属性(例如平移、旋转与形状)。该任务虽至关重要,但在计算机视觉界仍研究不足——部分原因在于缺乏适用于自动驾驶研究的大规模、全标注三维车辆数据库。本文贡献了首个适用于三维车辆实例理解的大规模数据库——ApolloCar3D。该数据集包含 5,277 张驾驶图像与超过 60K 个车辆实例,其中每辆车均拟合了一个工业级三维 CAD 模型,具有绝对模型尺寸与语义标注关键点。该数据集规模超过当前最优的 PASCAL3D+ 与 KITTI 的 20 倍。为实现高效的三维标注,我们构建了一条流水线,综合考虑单个实例的二维-三维关键点对应以及多个实例间的三维关系。借助该数据集,我们利用最先进的深度卷积神经网络构建了多种基线算法。具体而言,我们首先用预训练的 Mask R-CNN 分割每辆车,随后基于可变形三维车辆模型回归其三维姿态与形状(使用或不使用语义关键点)。我们表明使用关键点显著提升了拟合性能。最后,我们提出了一种联合考虑三维姿态与三维形状的新三维度量,以支持全面评估与消融研究。通过与人类表现对比,我们给出了若干未来改进方向。
引用
@article{arxiv.1811.12222,
title = {ApolloCar3D: A Large 3D Car Instance Understanding Benchmark for Autonomous Driving},
author = {Xibin Song and Peng Wang and Dingfu Zhou and Rui Zhu and Chenye Guan and Yuchao Dai and Hao Su and Hongdong Li and Ruigang Yang},
journal= {arXiv preprint arXiv:1811.12222},
year = {2018}
}