中文

S2R-DepthNet:学习可泛化的深度专用结构表示

计算机视觉与模式识别 2021-06-16 v2

摘要

人类可以从草图而非真实图像推断场景的三维几何结构,这表明空间结构在理解场景深度中起着基础性作用。我们首次探索学习一种深度专用结构表示,其捕获深度估计的本质特征并忽略无关的样式信息。我们的 S2R-DepthNet(Synthetic to Real DepthNet)即使仅在合成数据上训练,也能很好地直接泛化到未见的真实世界数据。S2R-DepthNet 包括:a) 结构提取(STE)模块,通过将图像解耦为域不变结构和域特定样式分量,从图像中提取域不变结构表示;b) 深度专用注意力(DSA)模块,学习任务特定知识以抑制与深度无关的结构,从而获得更好的深度估计与泛化;c) 深度预测模块(DP),从深度专用表示预测深度。在无需访问任何真实世界图像的情况下,我们的方法甚至优于使用目标域真实世界图像进行训练的最先进无监督域适应方法。此外,当使用少量带标注的真实世界数据时,我们在半监督设定下取得了最先进的性能。代码与训练好的模型可在 https://github.com/microsoft/S2R-DepthNet 获取。

关键词

引用

@article{arxiv.2104.00877,
  title  = {S2R-DepthNet: Learning a Generalizable Depth-specific Structural Representation},
  author = {Xiaotian Chen and Yuwang Wang and Xuejin Chen and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2104.00877},
  year   = {2021}
}

备注

Accepted by CVPR2021(oral)