具有全局上下文的视频对比学习
计算机视觉与模式识别
2021-08-06 v1 人工智能
机器学习
摘要
对比学习已革新了自监督图像表示学习领域,并近期被引入视频领域。对比学习的最大优势之一在于,只要能找到合理方式构造正样本与负样本进行对比,便可灵活定义强大的损失目标。然而,现有方法严重依赖短程时空显著性来形成片段级对比信号,从而限制了自身利用全局上下文的能力。本文提出一种基于视频片段构造正样本对的新型视频级对比学习方法。我们的构造能够捕获视频中的全局上下文,因而对时间内容变化具有鲁棒性。我们还引入时序顺序正则项以强化视频固有的序列结构。大量实验表明,我们的视频级对比学习框架(VCLR)在五个视频数据集上的下游动作分类、动作定位与视频检索任务中均优于以往最先进方法。代码见 https://github.com/amazon-research/video-contrastive-learning。
引用
@article{arxiv.2108.02722,
title = {Video Contrastive Learning with Global Context},
author = {Haofei Kuang and Yi Zhu and Zhi Zhang and Xinyu Li and Joseph Tighe and Sören Schwertfeger and Cyrill Stachniss and Mu Li},
journal= {arXiv preprint arXiv:2108.02722},
year = {2021}
}
备注
Code is publicly available at: https://github.com/amazon-research/video-contrastive-learning