中文

放松静观:通过观看SlowTV学习重建世界

计算机视觉与模式识别 2023-07-21 v1 人工智能 机器人学

摘要

自监督单目深度估计(SS-MDE)具有扩展到海量数据的潜力。遗憾的是,现有方法将自己局限于自动驾驶领域,导致模型无法泛化到自然或室内等复杂环境。为此,我们提出一个从YouTube上整理的大规模SlowTV数据集,其数据量比现有自动驾驶数据集高一个数量级。SlowTV包含来自丰富多样环境的170万张图像,例如全球季节性徒步、风景驾驶和水肺潜水。使用该数据集,我们训练了一个SS-MDE模型,可对大量室内/室外数据集实现零样本泛化。所得模型优于所有现有的自监督学习(SSL)方法,并缩小了与有监督最优(SoTA)的差距,尽管使用了更高效的架构。我们还引入了一系列最佳实践以进一步提升性能和零样本泛化能力,包括1)宽高比增强,2)相机内参估计,3)支持帧随机化,以及4)灵活运动估计。代码见 https://github.com/jspenmar/slowtv_monodepth。

关键词

引用

@article{arxiv.2307.10713,
  title  = {Kick Back & Relax: Learning to Reconstruct the World by Watching SlowTV},
  author = {Jaime Spencer and Chris Russell and Simon Hadfield and Richard Bowden},
  journal= {arXiv preprint arXiv:2307.10713},
  year   = {2023}
}

备注

Accepted to ICCV2023