MonoIndoor++:面向室内环境自监督单目深度估计的更优实践
计算机视觉与模式识别
2022-07-20 v1
摘要
自监督单目深度估计近年来取得了显著进展,尤其是在室外环境中。然而,在大多由手持设备捕获的现有数据的室内场景中,深度预测结果并不令人满意。与室外环境相比,使用自监督方法估计室内环境单目视频的深度会带来两个额外的挑战:(i)室内视频序列的深度范围在不同帧之间差异很大,使得深度网络难以归纳出一致的深度线索用于训练;(ii)用手持设备记录的室内序列通常包含更多的旋转运动,这给姿态网络预测准确的相对相机位姿带来困难。在这项工作中,我们通过针对这些挑战给予特殊考量并巩固一组改进室内环境自监督单目深度估计性能的良策,提出了一种新框架——MonoIndoor++。首先,提出了一个带有基于 transformer 的尺度回归网络的深度分解模块,用于显式估计全局深度尺度因子,且预测出的尺度因子可指示最大深度值。其次,不同于以往方法使用单阶段姿态估计策略,我们提出利用残差姿态估计模块迭代地估计连续帧间的相对相机位姿。第三,为了给我们的残差姿态估计模块引入广泛的坐标引导,我们提出直接在输入到姿态网络的数据上执行坐标卷积编码。所提方法在多种基准室内数据集(即 EuRoC MAV、NYUv2、ScanNet 和 7-Scenes)上进行了验证,展示了最先进的性能。
引用
@article{arxiv.2207.08951,
title = {MonoIndoor++:Towards Better Practice of Self-Supervised Monocular Depth Estimation for Indoor Environments},
author = {Runze Li and Pan Ji and Yi Xu and Bir Bhanu},
journal= {arXiv preprint arXiv:2207.08951},
year = {2022}
}
备注
Journal version of "MonoIndoor: Towards Good Practice of Self-Supervised Monocular Depth Estimation for Indoor Environments"(ICCV-2021). arXiv admin note: substantial text overlap with arXiv:2107.12429