通过选择性蒸馏立体视觉知识学习单目深度估计
计算机视觉与模式识别
2022-05-19 v1
摘要
基于深度学习的单目深度估计已被广泛研究,但其精度与泛化能力仍远落后于基于立体视觉的方法。为此,近期少数研究提出通过蒸馏视差图作为代理真值来监督单目深度估计网络。然而,这些研究不加区分地蒸馏立体知识,未考虑基于立体与单目的深度估计方法各自的相对优势。本文提出选择性蒸馏视差图以实现更可靠的代理监督。具体而言,我们首先设计一个解码器(MaskDecoder),学习两个二值掩码,训练其针对每个像素在代理视差图与估计深度图之间做出最优选择。随后将学习到的掩码输入另一解码器(DepthDecoder),以强制估计深度仅从代理视差图中被掩码覆盖的区域学习。此外,设计了一个教师-学生模块,将 StereoNet 的几何知识迁移至 MonoNet。大量实验验证,我们的方法在 KITTI 数据集上取得了自监督与代理监督单目深度估计的 SOTA 性能,甚至超越部分半监督方法。
引用
@article{arxiv.2205.08668,
title = {Learning Monocular Depth Estimation via Selective Distillation of Stereo Knowledge},
author = {Kyeongseob Song and Kuk-Jin Yoon},
journal= {arXiv preprint arXiv:2205.08668},
year = {2022}
}