中文

SSRFlow: 语义感知融合与时空重嵌入用于真实场景流

计算机视觉与模式识别 2024-08-16 v1 人工智能

摘要

场景流提供了从两个连续点云获取第一帧的3D运动场,对动态场景感知至关重要。然而,当代场景流方法面临三大挑战。首先,它们缺乏全局流嵌入,或仅在嵌入前考虑单个点云的上下文,导致嵌入点难以感知另一帧的一致语义关系。为解决此问题,我们提出了一种名为双交叉注意力(DCA)的新方法,用于基于语义上下文在两帧之间进行潜在融合与对齐。这随后被整合到全局融合流嵌入(GF)中,以基于上下文和欧几里得空间中的全局相关性初始化流嵌入。其次,非刚体物体在变形层之后存在形变,这会扭曲连续帧之间的时空关系。为更精确地估计下一层残差流,设计了时空重嵌入(STR)模块以更新当前层的点序列特征。最后,由于合成数据集与LiDAR扫描数据集之间存在显著的领域差距,常观察到泛化能力差的问题。我们利用新颖的领域自适应损失有效弥合了从合成到真实世界的运动推理差距。实验表明,我们的方法在多个数据集上取得了最先进的(SOTA)性能,在真实LiDAR扫描场景中取得了尤为突出的结果。我们的代码将在发表后发布。

关键词

引用

@article{arxiv.2408.07825,
  title  = {SSRFlow: Semantic-aware Fusion with Spatial Temporal Re-embedding for Real-world Scene Flow},
  author = {Zhiyang Lu and Qinghan Chen and Zhimin Yuan and Ming Cheng},
  journal= {arXiv preprint arXiv:2408.07825},
  year   = {2024}
}

备注

19 pages,12 figures. arXiv admin note: substantial text overlap with arXiv:2403.07032