探索用于多视角3D感知的循环长时域时序融合
计算机视觉与模式识别
2024-04-10 v3
摘要
长时域时序融合是基于摄像头的鸟瞰图(BEV)3D 感知中一项关键却常被忽视的技术。现有方法多为并行方式。虽然并行融合可受益于长时域信息,但随着融合窗口尺寸增大,其计算与内存开销也随之增加。与之相对,BEVFormer 采用循环融合流程以高效整合历史信息,却未能从更长的时序帧中获益。本文中,我们探索了一种构建于基于 LSS 的方法之上的极为简单的长时域循环融合策略,并发现其已能兼具两者优势,即丰富的长时域信息与高效的融合流程。进一步提出时序嵌入模块以提升模型在实际场景中偶发漏帧时的鲁棒性。我们将这一简单而有效的融合流程命名为 VideoBEV。在 nuScenes 基准上的实验结果表明,VideoBEV 在多项基于摄像头的 3D 感知任务上均取得强劲性能,包括目标检测(55.4\% mAP 与 62.9\% NDS)、分割(48.6\% 车辆 mIoU)、跟踪(54.8\% AMOTA)与运动预测(0.80m minADE 与 0.463 EPA)。
引用
@article{arxiv.2303.05970,
title = {Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception},
author = {Chunrui Han and Jinrong Yang and Jianjian Sun and Zheng Ge and Runpei Dong and Hongyu Zhou and Weixin Mao and Yuang Peng and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2303.05970},
year = {2024}
}