中文

CroMo:面向单目深度估计的跨模态学习

计算机视觉与模式识别 2022-03-30 v2

摘要

基于学习的深度估计近期在多个方向上取得了进展;从利用单目视频的自监督到提供最高精度的监督方法。作为监督的补充,通过结合来自多个信号的信息可进一步提升性能与鲁棒性。本文中,我们系统性地研究了与传感器和模态设计选择以及相关模型训练策略有关的关键权衡。我们的研究引出了一种新方法,能够连接来自偏振、飞行时间(Time-of-Flight)和结构光输入的模态特定优势。我们提出了一种能够从单目偏振估计深度的新颖流水线,并针对其评估了多种训练信号。可微解析模型的逆运算由此将场景几何与偏振和 ToF 信号相连,并实现了自监督与跨模态学习。在缺乏现有多模态数据集的情况下,我们使用定制多模态相机装置检验了我们的方法,并采集了 CroMo;首个由同步立体偏振、间接 ToF 和结构光深度组成、以视频帧率捕获的数据集。在具有挑战性的视频场景上的大量实验从定性与定量两方面证实了流水线的优势,我们能够优于有竞争力的单目深度估计方法。

关键词

引用

@article{arxiv.2203.12485,
  title  = {CroMo: Cross-Modal Learning for Monocular Depth Estimation},
  author = {Yannick Verdié and Jifei Song and Barnabé Mas and Benjamin Busam and Aleš Leonardis and Steven McDonagh},
  journal= {arXiv preprint arXiv:2203.12485},
  year   = {2022}
}

备注

Accepted for publication at CVPR2022