时间会给出答案:时序多视角三维目标检测的新视角与基线方法
计算机视觉与模式识别
2022-10-06 v1 人工智能
机器学习
机器人学
摘要
尽管近期仅依赖相机的三维检测方法利用了多个时间步,它们所使用的有限历史严重制约了时序融合改善目标感知的程度。观察到现有工作对多帧图像的融合属于时序立体匹配的范畴,我们发现性能受限于以下两者的相互作用:1)匹配分辨率的低粒度,以及 2)有限历史使用所产生的次优多视角设置。我们的理论与实证分析表明,视图间的最优时差对不同像素和深度差异显著,因而有必要在长程历史上融合许多时间步。基于我们的研究,我们提出从长程图像观测历史生成代价体,以更优的多视角匹配设置弥补粗糙但高效的匹配分辨率。此外,我们将用于长程粗糙匹配的逐帧单目深度预测与短程细粒度匹配相增强,并发现长程与短程时序融合高度互补。在保持高效率的同时,我们的框架在 nuScenes 上确立了新的 SOTA,在测试集上取得第一,并在验证集上以 5.2% mAP 和 3.7% NDS 超越此前最佳方法。代码将发布于
引用
@article{arxiv.2210.02443,
title = {Time Will Tell: New Outlooks and A Baseline for Temporal Multi-View 3D Object Detection},
author = {Jinhyung Park and Chenfeng Xu and Shijia Yang and Kurt Keutzer and Kris Kitani and Masayoshi Tomizuka and Wei Zhan},
journal= {arXiv preprint arXiv:2210.02443},
year = {2022}
}
备注
Code will be released at https://github.com/Divadi/SOLOFusion