中文

论自监督深度估计中图像合成损失的弊端

计算机视觉与模式识别 2021-10-12 v2

摘要

从立体和单目图像中估计场景深度对于提取三维信息以服务于场景理解等下游任务至关重要。近来,基于学习的深度估计方法因其在硬件选择上的高性能与灵活性而备受关注。然而,为这些算法收集用于监督训练的ground truth数据成本高昂甚至根本不可能。这一情况表明需要不要求对应深度测量的替代学习方法。事实上,深度估计的自监督学习提供了一种日益流行的替代方案。其基于如下思想:如果已知(或在此情况下估计出)场景的准确深度,则可以从相邻帧合成出观测帧。我们通过实验表明,与普遍看法相反,图像合成的改进并不必然带来深度估计的改进。相反,为图像合成进行优化可能导致相对于主要预测目标——深度——的性能出现背离。我们将这种背离现象归因于源自数据的偶然不确定性。基于我们在四个数据集(涵盖街道、室内和医疗)和五种架构(单目与立体)上的实验,我们得出结论:这种背离现象与数据集领域无关,且未被常用的正则化技术所缓解。为强调该发现的重要性,我们纳入了一项针对使用图像合成方法的调研,涵盖过去六年共127篇论文。这种观察到的背离此前未被报道或深入研究,表明受该发现影响的自监督方法尚有未来改进空间。

关键词

引用

@article{arxiv.2109.06163,
  title  = {On the Sins of Image Synthesis Loss for Self-supervised Depth Estimation},
  author = {Zhaoshuo Li and Nathan Drenkow and Hao Ding and Andy S. Ding and Alexander Lu and Francis X. Creighton and Russell H. Taylor and Mathias Unberath},
  journal= {arXiv preprint arXiv:2109.06163},
  year   = {2021}
}

备注

preprint