探索用于多模态三维目标检测的数据增强
计算机视觉与模式识别
2021-04-22 v2 人工智能
摘要
基于点云与图像的多模态方法仅比单纯使用点云的方法性能略好,甚至有时更差,这有悖直觉。本文探究了这一现象背后的原因。由于多模态数据增强必须保持点云与图像之间的一致性,该领域近期的方法通常采用相对不充分的数据增强。这一不足导致其性能低于预期。因此,我们贡献了一条称为变换流(transformation flow)的处理流程,通过变换反转与重放来弥合单模态与多模态数据增强之间的差距。此外,考虑到遮挡,不同模态中的同一个点可能被不同物体占据,使得剪切粘贴等增强对于多模态检测而言并非易事。我们进一步提出多模态剪切粘贴(MoCa),其同时考虑遮挡与物理合理性以维持多模态一致性。在不使用检测器集成的情况下,我们的多模态检测器在 nuScenes 数据集上取得了新的 SOTA 性能,并在 KITTI 3D 基准上获得了有竞争力的性能。我们的方法还在第三届 nuScenes 检测挑战赛中荣获最佳 PKL 奖。代码与模型将发布于 https://github.com/open-mmlab/mmdetection3d。
引用
@article{arxiv.2012.12741,
title = {Exploring Data Augmentation for Multi-Modality 3D Object Detection},
author = {Wenwei Zhang and Zhe Wang and Chen Change Loy},
journal= {arXiv preprint arXiv:2012.12741},
year = {2021}
}
备注
Technical Report