中文

通过时间对齐视频进行学习

计算机视觉与模式识别 2023-08-21 v2

摘要

我们提出了一种自监督方法,利用时间视频对齐作为 pretext task 来学习视频表示,同时利用帧级和视频级信息。我们采用了一种由时间对齐损失和时间正则化项组成的新颖组合,可作为训练编码器网络的监督信号。具体而言,时间对齐损失(即 Soft-DTW)旨在使视频在嵌入空间中时间对齐的代价最小。然而,仅优化该项会导致平凡解,特别是所有帧被映射到嵌入空间中一个小簇的情况。为克服该问题,我们提出一种时间正则化项(即 Contrastive-IDM),其鼓励不同帧被映射到嵌入空间中的不同点。在三个数据集(即 Pouring、Penn Action 和 IKEA ASM)上针对各种任务(包括动作阶段分类、动作阶段进展和细粒度帧检索)的广泛评估表明,我们的方法优于最先进的视频自监督表示学习方法。此外,在标注数据缺乏时,我们的方法提供了显著的性能增益。我们的代码和标签可在我们的研究网站获取:https://retrocausal.ai/research/

关键词

引用

@article{arxiv.2103.17260,
  title  = {Learning by Aligning Videos in Time},
  author = {Sanjay Haresh and Sateesh Kumar and Huseyin Coskun and Shahram Najam Syed and Andrey Konin and Muhammad Zeeshan Zia and Quoc-Huy Tran},
  journal= {arXiv preprint arXiv:2103.17260},
  year   = {2023}
}

备注

Presented at CVPR 2021