预测以检测:基于序列图像的预测引导三维目标检测
计算机视觉与模式识别
2023-09-06 v3
摘要
近期基于相机的三维目标检测方法引入序列帧以提升检测性能,期望多帧能够缓解较大的深度估计误差。尽管检测性能有所提升,已有工作依赖于朴素融合方法(如拼接)或局限于静态场景(如时间立体匹配),忽视了物体运动线索的重要性。这些方法未充分挖掘序列图像的潜力,性能提升有限。为应对该局限,我们提出一种新颖的三维目标检测模型 P2D(Predict to Detect),其将预测机制整合进检测框架以显式提取并利用运动特征。P2D 仅使用过去帧预测当前帧中的物体信息,从而学习时序运动特征。我们进而提出一种新颖的时序特征聚合方法,该方法基于预测的物体信息注意力式地利用鸟瞰图(BEV)特征,从而实现准确的三维目标检测。实验结果表明,与基于序列图像的基线相比,P2D 的 mAP 和 NDS 分别提升 3.0% 和 3.7%,说明引入预测机制可显著提升检测精度。
引用
@article{arxiv.2306.08528,
title = {Predict to Detect: Prediction-guided 3D Object Detection using Sequential Images},
author = {Sanmin Kim and Youngseok Kim and In-Jae Lee and Dongsuk Kum},
journal= {arXiv preprint arXiv:2306.08528},
year = {2023}
}
备注
ICCV 2023, Code: https://github.com/sanmin0312/P2D