中文

基于双向相机-激光雷达融合的光流与场景流学习

计算机视觉与模式识别 2024-04-09 v2

摘要

在本文中,我们研究从同步的 2D 和 3D 数据联合估计光流和场景流的问题。先前的方法要么采用将联合任务拆分为独立阶段的复杂流程,要么以“早期融合”或“晚期融合”方式融合 2D 和 3D 信息。这种一刀切的方法面临两难:无法充分利用各模态特性,或无法最大化模态间互补性。为解决这个问题,我们提出一种新颖的端到端框架,由 2D 和 3D 分支组成,在特定层之间具有多个双向融合连接。与之前工作不同,我们采用基于点的 3D 分支提取 LiDAR 特征,因其保留点云几何结构。为融合稠密图像特征与稀疏点特征,我们提出一个名为双向相机-激光雷达融合模块(Bi-CLFM)的可学习算子。我们实例化了两类双向融合流程,一种基于金字塔由粗到细架构(称为 CamLiPWC),另一种基于循环全配对场变换(称为 CamLiRAFT)。在 FlyingThings3D 上,CamLiPWC 和 CamLiRAFT 均超越所有现有方法,相较最佳已发表结果 3D 端点误差最高降低 47.9%。我们性能最佳的模型 CamLiRAFT 在 KITTI Scene Flow 基准上达到 4.26% 误差,以远少参数在所有提交中排名第 1。此外,我们的方法具有强泛化性能和处理非刚性运动的能力。代码见 https://github.com/MCG-NJU/CamLiFlow。

关键词

引用

@article{arxiv.2303.12017,
  title  = {Learning Optical Flow and Scene Flow with Bidirectional Camera-LiDAR Fusion},
  author = {Haisong Liu and Tao Lu and Yihui Xu and Jia Liu and Limin Wang},
  journal= {arXiv preprint arXiv:2303.12017},
  year   = {2024}
}

备注

Accepted to TPAMI 2023