中文

M3Net:面向自动驾驶的3D检测、分割与占据预测的多模态多任务学习

计算机视觉与模式识别 2025-03-25 v1

摘要

自动驾驶的感知系统通常需要处理多个多样化子任务。然而,当前算法通常单独处理各个子任务,导致在获取全方位感知结果时效率低下。一些多任务学习方法尝试用一个模型统一多个任务,但未解决多任务学习中的冲突。本文引入M3Net,一种新型的多模态多任务网络,同时处理自动驾驶的检测、分割和3D占据预测任务,优于单任务模型。M3Net以多模态数据为输入,通过查询token交互处理多个任务。为增强多模态特征在多任务学习中的集成,我们首先提出了Modality-Adaptive Feature Integration(MAFI)模块,使单模态特征能够为其表现良好的任务分别预测通道注意力权重。基于集成特征,我们 then develop task-specific query initialization strategies to accommodate the needs of detection/segmentation and 3D occupancy prediction。凭借正确初始化的查询,共享解码器逐层转换查询和BEV特征,促进了多任务学习。此外,我们在解码器中提出了面向任务的通道缩放(TCS)模块,以缓解针对不同任务优化之间的冲突。此外,我们提出的多任务查询和TCS模块支持Transformer-based decoder和Mamba-based decoder,显示其对不同架构的灵活性。M3Net在nuScenes基准测试中实现了多任务学习的状态最前沿性能。

关键词

引用

@article{arxiv.2503.18100,
  title  = {M3Net: Multimodal Multi-task Learning for 3D Detection, Segmentation, and Occupancy Prediction in Autonomous Driving},
  author = {Xuesong Chen and Shaoshuai Shi and Tao Ma and Jingqiu Zhou and Simon See and Ka Chun Cheung and Hongsheng Li},
  journal= {arXiv preprint arXiv:2503.18100},
  year   = {2025}
}

备注

Accepted by AAAI 2025