Kick Back & Relax++:利用 SlowTV 与 CribsTV 突破真实深度数据的扩展极限
计算机视觉与模式识别
2024-03-05 v1 人工智能
机器人学
摘要
自监督学习是解锁通用计算机视觉系统的关键。通过消除对真实标注的依赖,它允许扩展到更大规模的数据量。遗憾的是,自监督单目深度估计(SS-MDE)一直受限于缺乏多样化的训练数据。现有数据集仅专注于人口稠密城市的城市驾驶,导致模型无法在该领域之外泛化。为了解决这些局限性,本文提出了两个新颖的数据集:SlowTV 和 CribsTV。这些是从公开 YouTube 视频中精选的大规模数据集,共包含 200 万帧训练图像。它们提供了极其多样化的环境,从雪林、沿海公路、豪华宅邸到水下珊瑚礁。我们利用这些数据集来解决零样本泛化这一极具挑战性的任务,其表现超越了所有现有的 SS-MDE 方法,甚至超越了一些最先进的监督方法。我们模型的泛化能力还通过一系列组件和贡献得到了进一步增强:1) 学习相机内参,2) 针对宽高比变化的更强增强策略,3) 支持帧随机化,4) 灵活的运动估计,5) 现代的基于 Transformer 的架构。我们在大量的消融实验中展示了每个组件的有效性。为了促进未来研究的发展,我们将数据集、代码和预训练模型向公众开放,网址为 https://github.com/jspenmar/slowtv_monodepth。
引用
@article{arxiv.2403.01569,
title = {Kick Back & Relax++: Scaling Beyond Ground-Truth Depth with SlowTV & CribsTV},
author = {Jaime Spencer and Chris Russell and Simon Hadfield and Richard Bowden},
journal= {arXiv preprint arXiv:2403.01569},
year = {2024}
}