用于多目标跟踪的二维与三维特征交互式多尺度融合
计算机视觉与模式识别
2022-03-31 v1 机器人学
摘要
多目标跟踪(MOT)是实现自动驾驶的一项重要任务。传统工作尝试基于 LiDAR 采集的点云(PC)或基于相机捕获的图像来完成该任务。然而,依赖单一传感器不够鲁棒,因为它可能在跟踪过程中失效。另一方面,来自多模态的特征融合有助于提升精度。因此,基于不同传感器、融合多模态特征的新技术正在发展。来自 RGB 相机的纹理信息和来自激光雷达的 3D 结构信息在不同情形下各有优势。然而,由于信息模态完全不同,实现有效的特征融合并不容易。以往的融合方法通常在主干从不同模态提取特征后融合顶层特征。在本文中,我们首先引入 PointNet++ 以获取点云的多尺度深度表示,使其适应我们提出的图像与点云多尺度特征之间的交互式特征融合。具体而言,通过像素级与点级特征间的多尺度交互查询与融合,我们的方法能获得更具判别力的特征以提升多目标跟踪性能。此外,我们探索了在各单一模态上预训练并在基于融合的模型上微调的有效性。实验结果表明,我们的方法在 KITTI 基准上取得了良好性能,并优于其他未使用多尺度特征融合的方法。而且,消融研究指出了多尺度特征融合与单模态预训练的有效性。
引用
@article{arxiv.2203.16268,
title = {Interactive Multi-scale Fusion of 2D and 3D Features for Multi-object Tracking},
author = {Guangming Wang and Chensheng Peng and Jinpeng Zhang and Hesheng Wang},
journal= {arXiv preprint arXiv:2203.16268},
year = {2022}
}
备注
9 pages, 5 figures, under review