时间等变对比视频表征学习
计算机视觉与模式识别
2021-12-08 v1
摘要
我们提出一种新颖的自监督对比学习方法,从未标注视频中学习表征。现有方法忽略输入失真的具体特性,例如通过学习对时间变换的不变性。相反,我们认为视频表征应保留视频动态并反映输入的时间操纵。因此,我们利用新颖约束来构建对时间变换等变并更好捕捉视频动态的表征。在我们的方法中,视频增强片段之间的相对时间变换被编码为向量并与其他变换向量进行对比。为支持时间等变学习,我们还提出将视频的两个片段自监督分类为:1. 重叠,2. 有序,或 3. 无序。我们的实验表明,时间等变表征在 UCF101、HMDB51 和 Diving48 的视频检索和动作识别基准上取得了最先进的结果。
引用
@article{arxiv.2112.03624,
title = {Time-Equivariant Contrastive Video Representation Learning},
author = {Simon Jenni and Hailin Jin},
journal= {arXiv preprint arXiv:2112.03624},
year = {2021}
}
备注
ICCV 2021 (oral)