中文

CroCo v2:面向立体匹配与光流改进的跨视角补全预训练

计算机视觉与模式识别 2023-08-21 v3

摘要

尽管自监督预训练方法在高层下游任务上表现优异,其尚未在立体匹配或光流等稠密几何视觉任务上充分发挥作用。将实例判别或掩码图像建模等自监督概念应用于几何任务是一个活跃的研究领域。本工作中,我们基于近期的跨视角补全框架展开,该框架是掩码图像建模的一种变体,利用同一场景的第二视角,因而非常适用于双目下游任务。该概念的适用性迄今至少在两方面受限:(a)难以收集真实世界图像对——实践中仅使用了合成数据;(b)普通 transformer 对稠密下游任务的泛化不足,其中相对位置比绝对位置更有意义。我们探索了三条改进途径。首先,我们引入一种大规模收集合适真实世界图像对的方法。其次,我们实验相对位置嵌入,并表明其使视觉 transformer 性能大幅提升。第三,我们扩展了基于视觉 transformer 的跨补全架构,这得益于大量数据的使用。借助这些改进,我们首次证明无需任何如相关体、迭代估计、图像变形或多尺度推理等传统任务专用技术,即可在立体匹配与光流上达到最先进结果,从而为通用视觉模型铺平道路。

关键词

引用

@article{arxiv.2211.10408,
  title  = {CroCo v2: Improved Cross-view Completion Pre-training for Stereo Matching and Optical Flow},
  author = {Philippe Weinzaepfel and Thomas Lucas and Vincent Leroy and Yohann Cabon and Vaibhav Arora and Romain Brégier and Gabriela Csurka and Leonid Antsfeld and Boris Chidlovskii and Jérôme Revaud},
  journal= {arXiv preprint arXiv:2211.10408},
  year   = {2023}
}

备注

ICCV 2023