中文

学习用于像素级视频对应的细粒度特征

计算机视觉与模式识别 2023-08-08 v1

摘要

视频分析任务严重依赖于识别来自不同帧且对应于同一视觉目标的像素。为解决这个问题,近期研究提倡特征学习方法,旨在学习具有区分性的表示来匹配像素,尤其是以自监督方式。不幸的是,这些方法对于微小甚至单像素的视觉目标存在困难。像素级视频对应传统上与光流相关,然而光流导致确定性对应且在真实世界视频上缺乏鲁棒性。我们解决用于建立像素级对应的特征学习问题。受光流以及自监督特征学习的启发,我们提出不仅使用带标签的合成视频,还使用无标签的真实世界视频,在整体框架中学习细粒度表示。我们采用对抗学习方案来增强所学特征的泛化能力。此外,我们设计了一个由粗到细的框架以追求高计算效率。我们在一系列基于对应的任务上的实验结果表明,所提方法在准确率和效率上均优于 SOTA 对手。

关键词

引用

@article{arxiv.2308.03040,
  title  = {Learning Fine-Grained Features for Pixel-wise Video Correspondences},
  author = {Rui Li and Shenglong Zhou and Dong Liu},
  journal= {arXiv preprint arXiv:2308.03040},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Code and models are available at https://github.com/qianduoduolr/FGVC