驾驶前三思:面向端到端自动驾驶的可扩展解码器
计算机视觉与模式识别
2023-05-11 v1
摘要
端到端自动驾驶近年来取得了令人印象深刻的进展。现有方法通常采用解耦的编码器-解码器范式,其中编码器从原始传感器数据中提取隐藏特征,解码器输出自车未来的轨迹或动作。在此范式下,编码器无法获知自车主体的预期行为,将从海量感受野中找出安全关键区域并推断未来状况的负担留给了解码器。更糟的是,解码器通常由几个简单的多层感知机(MLP)或 GRU 组成,而编码器则经过精心设计(例如,重型 ResNets 或 Transformer 的组合)。这种不平衡的资源-任务划分阻碍了学习过程。在本工作中,我们旨在通过两个原则缓解上述问题:(1)充分利用编码器的能力;(2)增加解码器的能力。具体而言,我们首先基于编码器特征预测粗粒度的未来位置和动作。然后,以该位置和动作为条件,想象未来场景以检查若如此驾驶会产生的后果。我们还检索预测坐标周围的编码器特征,以获取关于安全关键区域的细粒度信息。最后,基于预测的未来和检索的显著特征,我们通过预测其与真实值的偏移来细化粗粒度的位置和动作。上述细化模块可以级联方式堆叠,从而以关于条件未来时空先验知识扩展解码器能力。我们在 CARLA 模拟器上进行实验,并在闭环基准中取得最先进性能。大量消融研究证明了每个提出模块的有效性。
引用
@article{arxiv.2305.06242,
title = {Think Twice before Driving: Towards Scalable Decoders for End-to-End Autonomous Driving},
author = {Xiaosong Jia and Penghao Wu and Li Chen and Jiangwei Xie and Conghui He and Junchi Yan and Hongyang Li},
journal= {arXiv preprint arXiv:2305.06242},
year = {2023}
}
备注
Accepted by CVPR 2023