中文

基于单目视频的视觉描述子学习

计算机视觉与模式识别 2020-04-16 v1

摘要

对应估计是计算机视觉中研究最广泛但仍未完全解决的领域之一,在物体与环境跟踪、建图和识别中有诸多应用。本文提出一种在 RGB 图像上估计稠密对应的新方法,通过训练全卷积网络从视频样本中学习视觉描述子。大多数深度学习方法通过使用大量昂贵的标注数据训练网络或利用 RGB-D 视频通过强 3D 生成模型进行标注来解决此问题。我们的方法使用对比损失从 RGB 视频中学习,其中相对标注由光流估计得到。我们在有地面真实信息的渲染视频上通过定量分析展示了功能性。该方法不仅在同一背景的测试数据上表现良好,还能泛化到新背景的情况。学到的描述子具有唯一性,且网络确定的表示是全局的。我们进一步展示了该方法在真实世界视频中的适用性。

关键词

引用

@article{arxiv.2004.07007,
  title  = {Visual Descriptor Learning from Monocular Video},
  author = {Umashankar Deekshith and Nishit Gajjar and Max Schwarz and Sven Behnke},
  journal= {arXiv preprint arXiv:2004.07007},
  year   = {2020}
}

备注

International Conference on Computer Vision Theory and Applications (VISAPP) 2020