中文

基于潜时间导航的自监督视频表示学习

计算机视觉与模式识别 2023-05-12 v1 人工智能

摘要

自监督视频表示学习旨在最大化同一视频不同时间片段间的相似性,以强制特征随时间持续。这导致与时序关系相关的关键信息丢失,使得“进入”和“离开”等动作无法区分。为缓解此局限,我们提出潜时间导航(LTN),一种时间参数化的对比学习策略,其经过精简以捕捉细粒度运动。具体而言,我们在最大化同一视频不同视频片段间表示相似性的同时,沿潜表示编码的一个子空间保持其对时间感知,该子空间包含表示时间变化的正交基。我们广泛的实验分析表明,通过 LTN 学习视频表示在细粒度和面向人的动作分类任务中(如 Toyota Smarthome 数据集)持续提升性能。此外,我们证明所提模型在 Kinetics-400 上预训练后,能很好泛化至未见的真实世界视频基准数据集 UCF101 和 HMDB51,在动作识别中取得最先进性能。

关键词

引用

@article{arxiv.2305.06437,
  title  = {Self-Supervised Video Representation Learning via Latent Time Navigation},
  author = {Di Yang and Yaohui Wang and Quan Kong and Antitza Dantcheva and Lorenzo Garattoni and Gianpiero Francesca and Francois Bremond},
  journal= {arXiv preprint arXiv:2305.06437},
  year   = {2023}
}

备注

AAAI 2023