中文

4D-Former:多模态 4D 全景分割

计算机视觉与模式识别 2023-11-21 v2 机器人学

摘要

4D 全景分割是一项具有挑战性但实用的任务,要求为 LiDAR 点云序列中每个点分配语义类别标签,并将个体对象随时间分割与跟踪。现有方法仅利用 LiDAR 输入,在点稀疏区域所传达信息有限。然而,该问题可通过利用提供基于外观信息、能强化基于几何的 LiDAR 特征的 RGB 相机图像来缓解。受此启发,我们提出 4D-Former:一种新颖的 4D 全景分割方法,其利用 LiDAR 与图像两种模态,并为输入点云序列预测语义掩码以及时间一致的对象掩码。我们使用一组简洁的查询 (queries) 对语义类别和对象进行编码,这些查询从两种数据模态中吸收特征信息。此外,我们提出一种学习的关联机制以随时间关联对象轨迹,该机制对外观与空间位置进行推理。我们将 4D-Former 应用于 nuScenes 与 SemanticKITTI 数据集,在其中取得了最先进 (state-of-the-art) 结果。

关键词

引用

@article{arxiv.2311.01520,
  title  = {4D-Former: Multimodal 4D Panoptic Segmentation},
  author = {Ali Athar and Enxu Li and Sergio Casas and Raquel Urtasun},
  journal= {arXiv preprint arXiv:2311.01520},
  year   = {2023}
}

备注

accepted at CoRL 2023