中文

GIM:从互联网视频中学习泛化图像匹配器

计算机视觉与模式识别 2024-02-20 v1

摘要

图像匹配是计算机视觉中的一个基本问题。虽然基于学习的方法在现有基准上取得了 SOTA 性能,但它们对自然场景图像的泛化能力较差。此类方法通常需要针对不同场景类型训练单独的模型,并且在场景类型事先未知时不切实际。潜在问题之一是现有数据构建流程的可扩展性有限,这限制了标准图像匹配数据集的多样性。为了解决这个问题,我们提出了 GIM,这是一个自训练框架,利用互联网视频这一丰富且多样的数据源,基于任何图像匹配架构学习单一泛化模型。给定一个架构,GIM 首先在标准特定领域数据集上对其进行训练,然后将其与互补的匹配方法结合,在新型视频的相邻帧上创建密集标签。这些标签通过稳健拟合进行过滤,然后通过将它们传播到远处帧来增强。最终模型在传播数据上使用强增强进行训练。我们还提出了 ZEB,这是第一个用于图像匹配的零样本评估基准。通过混合来自不同领域的数据,ZEB 可以彻底评估不同方法的跨领域泛化性能。应用 GIM 持续提高了 3 种 SOTA 图像匹配架构的零样本性能;使用 50 小时的 YouTube 视频,相对零样本性能提高了 8.4%-18.1%。GIM 还能够泛化到极端跨领域数据,例如投影 3D 点云的鸟瞰图(BEV)图像(图 1(c))。更重要的是,在各自领域固有的下游任务上进行评估时,我们的单一零样本模型始终优于特定领域的基线。视频演示可在 https://www.youtube.com/watch?v=FU_MJLD8LeY 获取。

关键词

引用

@article{arxiv.2402.11095,
  title  = {GIM: Learning Generalizable Image Matcher From Internet Videos},
  author = {Xuelun Shen and Zhipeng Cai and Wei Yin and Matthias Müller and Zijun Li and Kaixuan Wang and Xiaozhi Chen and Cheng Wang},
  journal= {arXiv preprint arXiv:2402.11095},
  year   = {2024}
}

备注

Accepted to ICLR 2024 for spotlight presentation