位置信息即你所需:一种从视频中进行自监督单视图深度估计的新流程
计算机视觉与模式识别
2022-05-19 v1 图像与视频处理
摘要
近来,以完全自监督方式从单目视频中学习场景底层 3D 结构受到广泛关注。该任务最具挑战性的方面之一是处理独立运动物体,因为它们打破了刚性场景假设。我们首次表明,可利用像素位置信息从视频中学习 SVDE(单视图深度估计,Single View Depth Estimation)。我们提出的运动物体(MO)掩码由偏移位置信息(SPI)诱导并称为“SPIMO”掩码,非常鲁棒且能稳定去除场景中的独立运动物体,从而更好地从视频中学习 SVDE。此外,我们引入一种新的自适应量化方案,为深度离散化分配最佳的逐像素量化曲线。最后,我们以新方式采用现有提升技术来进一步自监督运动物体的深度。凭借这些特性,我们的流程对运动物体具有鲁棒性,并能很好地泛化到高分辨率图像,即使以小块训练,也能以比先前从视频学习的工作少近 8.5 倍的参数取得最先进(SOTA)结果。我们在 KITTI 和 CityScapes 上进行了大量实验,证明了方法的有效性。
引用
@article{arxiv.2205.08851,
title = {Positional Information is All You Need: A Novel Pipeline for Self-Supervised SVDE from Videos},
author = {Juan Luis Gonzalez Bello and Jaeho Moon and Munchurl Kim},
journal= {arXiv preprint arXiv:2205.08851},
year = {2022}
}