中文

面向光流与场景流的自注意力多模态融合

计算机视觉与模式识别 2023-07-31 v1

摘要

本文研究了在RGB模态受噪声影响或于暗光环境下捕获时,利用RGBD信息估计光流与场景流的问题。现有方法通常仅依赖RGB图像或在后期阶段融合模态,当RGB信息不可靠时会导致精度降低。为解决此问题,我们提出一种名为FusionRAFT的新型深度神经网络方法,其实现传感器模态(RGB与深度)间的早期信息融合。我们的方法在不同网络层级引入自注意力与交叉注意力层,以构建利用两模态优势的信息性特征。通过对比实验,我们证明了该方法在合成数据集Flyingthings3D上的性能优于近期方法,并在真实世界数据集KITTI上展现出泛化能力。我们说明,在影响RGB图像的噪声与低光照条件下,我们的方法表现出改进的鲁棒性。我们在 https://github.com/jiesico/FusionRAFT 发布了代码、模型与数据集。

关键词

引用

@article{arxiv.2307.15301,
  title  = {Attentive Multimodal Fusion for Optical and Scene Flow},
  author = {Youjie Zhou and Guofeng Mei and Yiming Wang and Fabio Poiesi and Yi Wan},
  journal= {arXiv preprint arXiv:2307.15301},
  year   = {2023}
}

备注

This work is accepted for publication in IEEE Robotics and Automation Letters