中文

HENet++:用于 3D 感知和端到端自动驾驶的混合编码与多任务学习

计算机视觉与模式识别 2025-11-11 v1

摘要

三维特征提取是自动驾驶系统的关键组成部分,其中感知任务如 3D 对象检测、鸟瞰视图(BEV)语义分割和占据网格预测是 3D 特征的重要约束。尽管大尺寸图像编码器、高分辨率图像和长期时序输入可以显著提升特征质量并带来显著性能提升,但这些技术在训练和推理时常因计算资源限制而不兼容。此外,不同任务偏好不同的特征表示,使得单个模型在保持与单任务模型相当的准确度的同时,难以进行跨多任务的端到端推断。为此,我们提出了 HENet 和 HENet++ 框架,用于多任务 3D 感知和端到端自动驾驶。具体而言,我们提出了混合图像编码网络,针对短期帧使用大型图像编码器,针对长期帧使用小型编码器。此外,我们的框架同时提取稠密和稀疏特征,为不同任务提供更合适的表示,减少累积误差,并为规划模块提供更全面的信息。该架构与各种现有 3D 特征提取方法兼容,支持多模态输入。HENet++ 在 nuScenes 基准测试中实现了最新的端到端多任务 3D 感知结果,同时在 nuScenes 端到端自动驾驶基准测试中取得最低的碰撞率。

关键词

引用

@article{arxiv.2511.07106,
  title  = {HENet++: Hybrid Encoding and Multi-task Learning for 3D Perception and End-to-end Autonomous Driving},
  author = {Zhongyu Xia and Zhiwei Lin and Yongtao Wang and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2511.07106},
  year   = {2025}
}

备注

Preliminary version, 19 pages