中文

超越图像到深度:利用回声改进深度预测

计算机视觉与模式识别 2021-04-06 v2 声音

摘要

我们处理利用多模态视听数据估计深度的问题。受蝙蝠和海豚等动物利用回声定位推断物体距离能力的启发,一些近期方法已利用回声进行深度估计。我们提出一种基于端到端深度学习的流水线,利用 RGB 图像、双耳回声以及场景中各类物体的估计材料属性。我们认为,对于不同场景元素,图像、回声与深度之间的关系受这些元素属性显著影响,而设计用于利用该信息的方法可由此从视听输入实现显著改进的深度估计。我们提出一种新颖的多模态融合技术,在结合音频(回声)与视觉模态以预测场景深度时显式地纳入材料属性。我们通过 Replica 数据集上的实验凭经验表明,相较最先进的视听深度预测方法,所提方法在 RMSE 上获得 28% 的提升。为在更大数据集上展示方法有效性,我们在 Matterport3D 上报告了具竞争力的性能,并首次提议将其用作带回声的多模态深度预测基准。我们还通过详尽的消融实验与定性结果对提出的方法进行了分析。代码与模型可在 https://krantiparida.github.io/projects/bimgdepth.html 获取。

关键词

引用

@article{arxiv.2103.08468,
  title  = {Beyond Image to Depth: Improving Depth Prediction using Echoes},
  author = {Kranti Kumar Parida and Siddharth Srivastava and Gaurav Sharma},
  journal= {arXiv preprint arXiv:2103.08468},
  year   = {2021}
}

备注

To appear in CVPR 2021