中文

HENet:用于多视图摄像机端到端多任务 3D 感知的混合编码

计算机视觉与模式识别 2024-09-19 v3

摘要

从多视图摄像机获取三维感知是自动驾驶系统中的关键组件,涉及诸多任务,如 3D 对象检测和鸟瞰视图(BEV)语义分割。为提高感知精度,近期的 3D 感知模型已采用大型图像编码器、高分辨率图像和长期时序输入,带来了显著的性能提升。然而,这些技术常因计算资源限制在训练和推理场景中不兼容。此外,现代自动驾驶系统倾向于采用端到端框架进行多任务 3D 感知,可简化整体系统架构并减少实现复杂度。然而,在端到端 3D 感知模型中联合优化多个任务时,常常会出现任务间冲突。为缓解这些问题,本文提出一种名为 HENet 的端到端框架,用于多任务 3D 感知。具体而言,我们提出了混合图像编码网络,为短期帧使用大型图像编码器,为长期时序帧使用小型图像编码器。随后,我们引入基于注意力机制的时序特征集成模块,以融合由上述两种混合图像编码器提取的不同帧特征。最后,根据每个感知任务的特征,分别使用不同网格大小的 BEV 特征、独立的 BEV 编码器和任务解码器。实验结果表明,HENet 在 nuScenes 基准测试中实现了端到端多任务 3D 感知的拔得眉球,包括 3D 对象检测和 BEV 语义分割。源代码和模型将在 https://github.com/VDIGPKU/HENet 上发布。

关键词

引用

@article{arxiv.2404.02517,
  title  = {HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view Cameras},
  author = {Zhongyu Xia and ZhiWei Lin and Xinhao Wang and Yongtao Wang and Yun Xing and Shengxiang Qi and Nan Dong and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2404.02517},
  year   = {2024}
}

备注

ECCV 2024