中文

MaskFuser:基于联合多模态分词的掩码化融合用于端到端自动驾驶

计算机视觉与模式识别 2024-05-14 v1

摘要

当前的多模态驾驶框架通常通过利用单模态分支之间的注意力机制来融合表示。然而,现有网络仍抑制了驾驶性能,因为图像和 LiDAR 分支是独立的,缺乏统一的观察表示。因此,本文提出了 MaskFuser,将各种模态 tokenize 成统一的语义特征空间,并为后续的行为克隆提供联合表示。在统一的 token 表示基础上,MaskFuser 是首个引入跨模态掩码自编码器训练的工作。掩码化训练通过对被掩码 token 的重建来增强融合表示。从结构上讲,提出了一种混合融合网络,以结合早期融合和晚期融合的优势:在早期融合阶段,通过在分支之间执行单调转 BEV 翻译注意力来融合模态;在晚期融合中,通过将各种模态 tokenize 成统一的 token 空间并在其上进行共享编码来实现融合。MaskFuser 在 CARLA LongSet6 基准评估中分别达到了驾驶得分 49.05 和路径完成率 92.85%,分别比之前最佳基线提高了 1.74 和 3.21%。所引入的掩码融合在损坏感知输入下提高了驾驶稳定性。MaskFuser 在感知掩码比例为 25%、50% 和 75% 时,分别在驾驶得分上优于之前最佳基线提升了 6.55(27.8%)、1.53(13.8%)和 1.57(30.9%)。

关键词

引用

@article{arxiv.2405.07573,
  title  = {MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving},
  author = {Yiqun Duan and Xianda Guo and Zheng Zhu and Zhen Wang and Yu-Kai Wang and Chin-Teng Lin},
  journal= {arXiv preprint arXiv:2405.07573},
  year   = {2024}
}