用于自监督单目深度估计的语义引导表示学习
计算机视觉与模式识别
2020-02-28 v1 机器学习
摘要
自监督学习在单目深度估计中展现出巨大前景,使用几何作为唯一的监督来源。深度网络确实能够通过隐式利用类别级模式来学习将视觉外观与 3D 属性相关联的表示。在这项工作中,我们研究如何更直接地利用这种语义结构来引导几何表示学习,同时保持在自监督机制中。我们不使用语义标签和多任务方法中的代理损失,而是提出一种利用固定的预训练语义分割网络通过像素自适应卷积来引导自监督表示学习的新架构。此外,我们提出一个两阶段训练过程,通过重采样来克服动态物体上常见的语义偏差。我们的方法在所有像素、细粒度细节和每个语义类别上改进了自监督单目深度预测的最优性能(SOTA)。
引用
@article{arxiv.2002.12319,
title = {Semantically-Guided Representation Learning for Self-Supervised Monocular Depth},
author = {Vitor Guizilini and Rui Hou and Jie Li and Rares Ambrus and Adrien Gaidon},
journal= {arXiv preprint arXiv:2002.12319},
year = {2020}
}
备注
Proceedings of the Eighth International Conference on Learning Representations (ICLR 2020)