NimbleD:利用伪标签和大规模视频预训练提升自监督单目深度估计
计算机视觉与模式识别
2024-08-27 v1
摘要
我们介绍NimbleD,这是一个高效的自监督单目深度估计学习框架,集成了来自大型视觉模型生成的伪标签 supervision。该框架不需要相机内参,能够在公开可用的视频上进行大规模预训练。我们的 straightforward yet effective 学习策略显著提升了快速轻量模型的性能,而不会引入任何额外开销,使其能够实现与最先进自监督单目深度估计模型相当的性能。这一进展对于需要低延迟推理的虚拟现实和增强现实应用具有重要益处。源代码、模型权重和致谢均可在https://github.com/xapaxca/nimbled获取。
引用
@article{arxiv.2408.14177,
title = {NimbleD: Enhancing Self-supervised Monocular Depth Estimation with Pseudo-labels and Large-scale Video Pre-training},
author = {Albert Luginov and Muhammad Shahzad},
journal= {arXiv preprint arXiv:2408.14177},
year = {2024}
}