基于潜时间导航的自监督视频表示学习
计算机视觉与模式识别
2023-05-12 v1 人工智能
摘要
自监督视频表示学习旨在最大化同一视频不同时间片段间的相似性,以强制特征随时间持续。这导致与时序关系相关的关键信息丢失,使得“进入”和“离开”等动作无法区分。为缓解此局限,我们提出潜时间导航(LTN),一种时间参数化的对比学习策略,其经过精简以捕捉细粒度运动。具体而言,我们在最大化同一视频不同视频片段间表示相似性的同时,沿潜表示编码的一个子空间保持其对时间感知,该子空间包含表示时间变化的正交基。我们广泛的实验分析表明,通过 LTN 学习视频表示在细粒度和面向人的动作分类任务中(如 Toyota Smarthome 数据集)持续提升性能。此外,我们证明所提模型在 Kinetics-400 上预训练后,能很好泛化至未见的真实世界视频基准数据集 UCF101 和 HMDB51,在动作识别中取得最先进性能。
引用
@article{arxiv.2305.06437,
title = {Self-Supervised Video Representation Learning via Latent Time Navigation},
author = {Di Yang and Yaohui Wang and Quan Kong and Antitza Dantcheva and Lorenzo Garattoni and Gianpiero Francesca and Francois Bremond},
journal= {arXiv preprint arXiv:2305.06437},
year = {2023}
}
备注
AAAI 2023