中文

基于对极时空网络的多视角深度估计

计算机视觉与模式识别 2021-07-13 v3

摘要

我们提出一种从单段视频进行多视角深度估计的新方法,该任务是感知、重建和机器人导航等多种应用中的关键任务。尽管先前基于学习的方法已展示引人注目的结果,多数工作独立估计各视频帧的深度图,未考虑帧间强烈的几何与时间一致性。此外,当前最先进(SOTA)模型大多采用全 3D 卷积网络进行代价正则化,因而需要高计算成本,限制了其在现实应用中的部署。我们的方法通过使用新型对极时空(Epipolar Spatio-Temporal, EST)变换器显式关联几何与时间相关性及多个估计深度图,实现时间一致的深度估计结果。此外,为降低计算成本,受近期混合专家(Mixture-of-Experts)模型启发,我们设计了一种紧凑混合网络,由 2D 上下文感知网络与 3D 匹配网络组成,分别学习 2D 上下文信息与 3D 视差线索。大量实验表明,我们的方法在深度估计上比 SOTA 方法取得更高精度与显著加速。

关键词

引用

@article{arxiv.2011.13118,
  title  = {Multi-view Depth Estimation using Epipolar Spatio-Temporal Networks},
  author = {Xiaoxiao Long and Lingjie Liu and Wei Li and Christian Theobalt and Wenping Wang},
  journal= {arXiv preprint arXiv:2011.13118},
  year   = {2021}
}