中文

动态场景下基于多尺度特征融合的多帧自监督深度估计

计算机视觉与模式识别 2023-12-20 v2 机器人学

摘要

多帧方法通过特征匹配聚合时空信息,改善了单帧方法的单目深度估计。然而,时空特征在动态场景中会导致精度下降。为提升性能,近期方法倾向于提出复杂架构用于特征匹配与动态场景。本文中,我们表明一个简单学习框架配合所设计的特征增强即可取得优越性能。(1)提出一种具有几何可解释性的动态物体检测方法。检测出的动态物体在训练中被排除,保证了静态环境假设并缓解了多帧深度估计的精度下降问题。(2)提出多尺度特征融合用于多帧深度网络中的特征匹配,改善了特征匹配,尤其对于具有大幅相机运动的帧间。(3)提出具有鲁棒教师网络与可靠性保证的鲁棒知识蒸馏,在不增加测试计算复杂度的前提下改善了多帧深度估计。实验表明,我们提出的方法在多帧深度估计上取得了显著的性能提升。

关键词

引用

@article{arxiv.2303.14628,
  title  = {Multi-Frame Self-Supervised Depth Estimation with Multi-Scale Feature Fusion in Dynamic Scenes},
  author = {Jiquan Zhong and Xiaolin Huang and Xiao Yu},
  journal= {arXiv preprint arXiv:2303.14628},
  year   = {2023}
}

备注

11 pages, 8 figures, ACM MM'23 accepted