TEOcc:基于时间增强的雷达-摄像头多模态占据预测
计算机视觉与模式识别
2024-10-16 v1
摘要
语义占据作为一种新的三维场景表示方法近年来受到广泛关注。然而,现有的占据预测方法主要 focus 在设计更好的占据表示,如三视图或神经辐射场,却忽略了利用长时序信息的优势。本文提出一种雷达-摄像头多模态时序增强占据预测网络,命名为 TEOcc。我们受到在 3D 目标检测中利用时序信息成功经验的启发,具体引入时序增强分支来学习时序占据预测。在该分支中,我们随机丢弃第 t-k 个输入帧的多视图相机信息,分别利用来自其他相邻帧和多模态输入的长期和短期时序解码器预测其 3D 占据。此外,为降低计算成本并融合多模态输入,我们专门设计了用于长期和短期时序解码器的 3D 卷积层。 Furthermore,由于轻量级占据预测头部是一个稠密分类头部,我们提出在时序增强分支和主分支之间共享占据预测头部。值得注意的是,时序增强分支仅在训练时执行,推理时会被丢弃。实验结果表明,TEOcc 在 nuScenes 数据集上实现了占据预测的状态突破。此外,提出的时序增强分支是一个即插即用模块,可轻易集成到现有的占据预测方法中,以提升占据预测性能。代码和模型将在 https://github.com/VDIGPKU/TEOcc 发布。
引用
@article{arxiv.2410.11228,
title = {TEOcc: Radar-camera Multi-modal Occupancy Prediction via Temporal Enhancement},
author = {Zhiwei Lin and Hongbo Jin and Yongtao Wang and Yufei Wei and Nan Dong},
journal= {arXiv preprint arXiv:2410.11228},
year = {2024}
}
备注
Accepted by ECAI2024