中文

LiDAR 场景流量的4D体素网络方法

计算机视觉与模式识别 2024-07-12 v1

摘要

理解周围环境的运动状态对于安全的自动驾驶至关重要。这些运动状态可以从场景流中准确获得,后者捕捉点云的三维运动场。现有的LiDAR场景流方法从每个点云中提取空间特征,然后按通道方式融合,导致潜在地从未显式地提取时空特征。此外,它们利用2D鸟瞰图并仅处理两个帧,忽略了沿Z轴的关键空间信息以及更广泛的时序上下文,导致性能不佳。为此,我们提出了Flow4D,通过3D空间体素编码器后进行时间融合,使时空特征的显式提取成为可能。然而,虽然使用4D卷积提高了性能,但计算负担显著增加。为进一步提高效率,我们引入了时空分解模块(STDB),其结合了3D和1D卷积而非使用笨重的4D卷积。此外,Flow4D进一步利用五帧数据以获取更丰富的时序信息。结果,该方法在SOTA基础上实现了45.9%的性能提升,同时实现实时运行,并在2024年Argoverse 2场景流挑战中获得第一名。代码已公开于https://github.com/dgist-cvlab/Flow4D。

关键词

引用

@article{arxiv.2407.07995,
  title  = {Flow4D: Leveraging 4D Voxel Network for LiDAR Scene Flow Estimation},
  author = {Jaeyeul Kim and Jungwan Woo and Ukcheol Shin and Jean Oh and Sunghoon Im},
  journal= {arXiv preprint arXiv:2407.07995},
  year   = {2024}
}

备注

8 pages, 4 figures