中文

M-FUSE:用于场景流估计的多帧融合

计算机视觉与模式识别 2022-10-31 v2

摘要

近来,用于场景流估计的神经网络在 KITTI 基准等自动驾驶数据上展现出令人印象深刻的成果。然而,尽管使用了复杂的刚性假设与参数化,此类网络通常仅限于两帧对,无法利用时间信息。在本文中,我们通过提出一种考虑额外前一立体对的新颖多帧方法来解决这一缺陷。为此,我们分两步进行:首先,基于近期的 RAFT-3D 方法,我们通过引入一种先进的立体方法开发了改进的双帧基线。其次,且更为重要的是,利用 RAFT-3D 的特定建模概念,我们提出一种 U-Net 架构,其对前向与后向流估计进行融合,从而允许按需整合时间信息。在 KITTI 基准上的实验不仅表明改进基线与时间融合方法的优势相互补充,也证明所计算的场景流高度准确。更确切地说,我们的方法总体排名第二,在更具挑战性的前景对象上排名第一,总体上比原始 RAFT-3D 方法高出 16% 以上。代码见 https://github.com/cv-stuttgart/M-FUSE。

关键词

引用

@article{arxiv.2207.05704,
  title  = {M-FUSE: Multi-frame Fusion for Scene Flow Estimation},
  author = {Lukas Mehl and Azin Jahedi and Jenny Schmalfuss and Andrés Bruhn},
  journal= {arXiv preprint arXiv:2207.05704},
  year   = {2022}
}

备注

Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2023. Copyright: IEEE