中文

面向长尾三维检测

计算机视觉与模式识别 2023-05-23 v2 机器人学

摘要

当代自动驾驶车辆(AV)基准已推进了训练3D检测器的技术,尤其是在大规模激光雷达数据上。令人惊讶的是,尽管语义类标签自然遵循长尾分布,当代基准仅关注少数常见类(如行人和汽车)而忽略了尾部许多稀有类(如碎片和婴儿车)。然而,AV仍须检测稀有类以确保安全行驶。此外,语义类常按层次组织,例如儿童和建设工人等尾部类可论证为行人的子类。但这种层次关系常被忽略,可能导致性能估计误导及算法创新机会的错失。我们通过正式研究长尾3D检测(LT3D)问题来应对这些挑战,该问题在所有类(包括尾部类)上评估。我们评估并改进了流行的3D检测代码库(如CenterPoint和PointPillars),使其适配LT3D。我们开发了促进常见类与稀有类间特征共享的层次化损失,以及尊重层次结构对“合理”错误(如将儿童误认为成人)给予部分信用的改进检测指标。最后,我们指出通过RGB图像与LiDAR的多模态融合可特别提升细粒度尾部类的精度;简言之,稀疏(激光雷达)几何 alone难以识别小的细粒度类,表明多模态线索对长尾3D检测至关重要。我们的修改使所有类平均精度提升5% AP,并大幅改进稀有类AP(如婴儿车AP从3.6提升至31.6)!我们的代码见 https://github.com/neeharperi/LT3D

关键词

引用

@article{arxiv.2211.08691,
  title  = {Towards Long-Tailed 3D Detection},
  author = {Neehar Peri and Achal Dave and Deva Ramanan and Shu Kong},
  journal= {arXiv preprint arXiv:2211.08691},
  year   = {2023}
}

备注

This work has been accepted to the Conference on Robot Learning (CoRL) 2022