中文

AsyncBEV:异步3D目标检测中的跨模态流对齐

计算机视觉与模式识别 2026-01-21 v1

摘要

在自动驾驶中,诸如3D目标检测等多模态感知任务在训练和推理阶段均依赖于良好同步的传感器。然而,尽管使用了基于硬件或软件的同步算法,完美的同步极少能得到保证:传感器可能以不同频率运行,且网络延迟、硬件故障或处理瓶颈等现实世界因素常在传感器之间引入时间偏移。这种异步性会降低感知性能,尤其是对于动态目标。为应对这一挑战,我们提出了 AsyncBEV,一个可训练的轻量级通用模块,用于提升 3D 鸟瞰图(BEV)目标检测模型对传感器异步性的鲁棒性。受场景流估计启发,AsyncBEV 首先根据两种不同传感器模态的 BEV 特征估计 2D 流,并考虑这些传感器测量之间已知的时间偏移。随后,预测的特征流被用于扭曲并空间对齐特征图,我们表明该操作可轻松集成到不同的现有 BEV 检测器架构中(例如,基于 BEV 网格和基于 token 的架构)。大量实验表明,AsyncBEV 提升了基于 token 的 CMT 和基于网格的 UniBEV 对 LiDAR 或相机传感器之间小幅与大幅异步性的鲁棒性,尤其是对动态目标。我们显著优于采用自车运动补偿的 CMT 和 UniBEV 基线,在 0.5s0.5 s 时间偏移的最坏情况下,动态目标的 NDS 分别提升了 16.616.6% 和 11.911.9%。代码将在论文被接收后发布。

关键词

引用

@article{arxiv.2601.12994,
  title  = {AsyncBEV: Cross-modal Flow Alignment in Asynchronous 3D Object Detection},
  author = {Shiming Wang and Holger Caesar and Liangliang Nan and Julian F. P. Kooij},
  journal= {arXiv preprint arXiv:2601.12994},
  year   = {2026}
}