中文

$S^3$Net:利用单目视频与合成数据的语义感知自监督深度估计

计算机视觉与模式识别 2020-07-30 v1

摘要

用单目相机解决深度估计,使相机作为低成本深度估计传感器在自动驾驶与机器人等应用中广泛使用的可能性得以实现。然而,学习如此可扩展的深度估计模型需要大量标注数据,而收集成本高昂。现有两种流行的无需标注深度图的方法:(i) 在对抗框架中使用标注合成数据与未标注真实数据以预测更准确深度,以及 (ii) 利用单目视频帧中跨空间与时间的几何结构的无监督模型。理想情况下,我们愿利用两种方法提供的特征,因其互补;然而现有方法未充分开发这些叠加益处。我们提出 S3S^3Net,一个结合这些互补特征的自监督框架:我们使用合成与真实图像训练,同时利用几何、时间以及语义约束。我们新颖的整合架构在单目视频自监督深度估计中创下新的 SOTA。我们提出训练该自监督框架的独特方式,并取得 (i) 较先前使用域适应的合成监督方法超过 15%15\% 的提升,以及 (ii) 较先前利用真实数据几何约束的自监督方法超过 10%10\% 的提升。

关键词

引用

@article{arxiv.2007.14511,
  title  = {$S^3$Net: Semantic-Aware Self-supervised Depth Estimation with Monocular Videos and Synthetic Data},
  author = {Bin Cheng and Inderjot Singh Saggu and Raunak Shah and Gaurav Bansal and Dinesh Bharadia},
  journal= {arXiv preprint arXiv:2007.14511},
  year   = {2020}
}