中文

探索面向自动驾驶感知的相机编码器设计

计算机视觉与模式识别 2024-07-11 v1 人工智能

摘要

自动驾驶汽车 (AV) 的基石是可靠的感知系统,其中相机编码器起着至关重要的作用。现有工作通常利用为通用视觉任务(如图像分类、分割和 2D 检测)设计的预训练卷积神经网络 (CNN) 或 Vision Transformers (ViTs)。尽管这些知名架构在 AV 相关任务(例如 3D 目标检测)中取得了 SOTA 的准确率,但由于工业级 AV 数据集的细微复杂性,网络设计仍有巨大的改进潜力。此外,现有的公开 AV 基准通常包含不充足的数据,这可能导致对这些架构的评估不准确。为了揭示 AV 特定的模型见解,我们从标准通用编码器 ConvNeXt 出发,逐步转化设计。我们调整了不同的设计参数,包括模型的宽度和深度、阶段计算比率、注意力机制和输入分辨率,并对每次修改进行了系统分析。这种定制化产生了一种针对 AV 相机编码器优化的架构,其 mAP 比基线提高了 8.79%。我们相信,我们的努力可以成为 AV 图像编码器的优秀指南,并为下一代驾驶系统铺平道路。

关键词

引用

@article{arxiv.2407.07276,
  title  = {Exploring Camera Encoder Designs for Autonomous Driving Perception},
  author = {Barath Lakshmanan and Joshua Chen and Shiyi Lan and Maying Shen and Zhiding Yu and Jose M. Alvarez},
  journal= {arXiv preprint arXiv:2407.07276},
  year   = {2024}
}