中文

在空间与时间上对齐视频

计算机视觉与模式识别 2020-07-10 v1

摘要

在本文中,我们关注跨视频提取视觉对应关系的任务。给定来自某个动作类别的查询视频片段,我们的目标是在空间和时间上将其与训练视频对齐。为这种细粒度对齐任务获取训练数据具有挑战性且往往存在歧义。因此,我们提出了一种新颖的对齐过程,通过跨视频循环一致性来学习这种空间和时间上的对应关系。在训练期间,给定一对视频,我们计算循环,通过在第二个视频中的帧进行匹配,将第一个视频中给定帧内的图块连接起来。连接重叠图块的循环被鼓励获得比连接非重叠图块的循环更高的分数。我们在 Penn Action 和 Pouring 数据集上的实验表明,所提出的方法能够成功学习跨视频的语义相似图块的对应关系,并学习到对物体和动作状态敏感的表示。

关键词

引用

@article{arxiv.2007.04515,
  title  = {Aligning Videos in Space and Time},
  author = {Senthil Purushwalkam and Tian Ye and Saurabh Gupta and Abhinav Gupta},
  journal= {arXiv preprint arXiv:2007.04515},
  year   = {2020}
}

备注

To appear at the European Conference on Computer Vision (ECCV) 2020