用于自动三维标注与物体检测的多模态 Transformer
计算机视觉与模式识别
2022-07-21 v1
摘要
尽管为训练三维物体检测模型收集的数据集日益增多,在 LiDAR 扫描上标注三维框仍需要大量人力。为自动化标注并促进各类定制数据集的生产,我们提出了一种端到端多模态 Transformer(MTrans)自动标注器,其利用 LiDAR 扫描与图像,从弱二维边界框生成精确的三维框标注。为缓解阻碍现有自动标注器的普遍稀疏性问题,MTrans 基于二维图像信息生成新三维点以稠化稀疏点云。借助多任务设计,MTrans 同时分割前景/背景、稠化 LiDAR 点云并回归三维框。实验结果验证了 MTrans 在提升生成标签质量上的有效性。通过丰富稀疏点云,相较 SOTA 自动标注器,我们的方法在 KITTI 中等与困难样本上分别取得高 4.48% 与 4.03% 的三维 AP。MTrans 也可扩展用于提升三维物体检测精度,在 KITTI 困难样本上达到显著的 89.45% AP。代码见 \url{https://github.com/Cliu2/MTrans}。
引用
@article{arxiv.2207.09805,
title = {Multimodal Transformer for Automatic 3D Annotation and Object Detection},
author = {Chang Liu and Xiaoyan Qian and Binxiao Huang and Xiaojuan Qi and Edmund Lam and Siew-Chong Tan and Ngai Wong},
journal= {arXiv preprint arXiv:2207.09805},
year = {2022}
}
备注
14 pages, 4 figures