中文

探索自监督视频表示学习中的时间粒度

计算机视觉与模式识别 2021-12-09 v1 机器学习

摘要

本工作提出了一个名为 TeG 的自监督学习框架,以探索学习视频表示中的时间粒度。在 TeG 中,我们从视频中采样一个长片段和一个位于长片段内的短片段。然后我们提取它们的密集时间嵌入。训练目标由两部分组成:一个细粒度时间学习目标,用于最大化短片段和长片段中对应时间嵌入之间的相似性;以及一个持久时间学习目标,用于拉近两个片段的全局嵌入。我们的研究揭示了时间粒度的影响,得出三个主要发现:1) 不同的视频任务可能需要不同时间粒度的特征。2) 有趣的是,一些被广泛认为需要时间感知的任务实际上可以通过时间持久特征得到很好的解决。3) TeG 的灵活性在 8 个视频基准上取得了 SOTA 结果,在大多数情况下优于监督预训练。

关键词

引用

@article{arxiv.2112.04480,
  title  = {Exploring Temporal Granularity in Self-Supervised Video Representation Learning},
  author = {Rui Qian and Yeqing Li and Liangzhe Yuan and Boqing Gong and Ting Liu and Matthew Brown and Serge Belongie and Ming-Hsuan Yang and Hartwig Adam and Yin Cui},
  journal= {arXiv preprint arXiv:2112.04480},
  year   = {2021}
}