VoxelTrack: 探索用于3D点云目标跟踪的体素表示
计算机视觉与模式识别
2024-08-06 v1
摘要
当前的LiDAR点云基于3D单目标跟踪(Single Object Tracking, SOT)的方法通常依赖于基于点的表示网络。尽管已展示成功,但此类网络存在一些根本性问题: 1)其中包含池化操作以应对本质上无序的点云,阻碍了捕获对跟踪任务有用的3D空间信息。 2)所采用的集合抽象操作很少处理密度不一致的点云,也阻碍了对3D空间信息的建模。为解决这些问题,我们引入了一种新框架,称为VoxelTrack。通过将本质上无序的点云体素化为3D体素并通过稀疏卷积块提取其特征,VoxelTrack有效地建模了精确且稳健的3D空间信息,从而指导对被跟踪对象的准确位置预测。此外,VoxelTrack包含双流编码器和跨迭代特征融合模块,以进一步探索跟踪的细粒度3D空间信息。凭借准确的3D空间信息被建模,VoxelTrack简化了跟踪管道,只使用单个回归损失。对三个广泛采用的数据集进行了大量实验,包括KITTI、NuScenes和Waymo Open Dataset。实验结果确认,VoxelTrack在三个数据集上分别实现了最高性能(分别为88.3%、71.4%和63.6%的平均精度),并在单个TITAN RTX GPU上以36 FPS的实时速度超越现有跟踪器。源代码和模型将公开发布。
引用
@article{arxiv.2408.02263,
title = {VoxelTrack: Exploring Voxel Representation for 3D Point Cloud Object Tracking},
author = {Yuxuan Lu and Jiahao Nie and Zhiwei He and Hongjie Gu and Xudong Lv},
journal= {arXiv preprint arXiv:2408.02263},
year = {2024}
}