通过视频不一致性检测的自监督视频表示学习
计算机视觉与模式识别
2021-09-28 v1
摘要
本文提出了一种新颖的自监督方法,利用不一致性检测进行视频表示学习。该方法源于一个观察:人类视觉系统能够基于对视频的全面理解轻松识别视频中的不一致性。具体而言,训练样本(称为不一致片段)由从同一原始视频中分层采样的多个子片段构成,各子片段之间存在不同长度的不一致性。网络通过给定不一致片段作为输入,预测不一致性的位置和长度来学习高层表示。此外,引入视频内对比学习以最大化来自同一原始视频的不一致片段之间的互信息。我们通过在动作识别和视频检索上的广泛实验,使用多种骨干网络评估所提出的方法。实验表明,与先前基于一致性的方法相比,我们的方法在不同的骨干网络和数据集上均达到了最先进的性能。
引用
@article{arxiv.2109.12493,
title = {Self-Supervised Video Representation Learning by Video Incoherence Detection},
author = {Haozhi Cao and Yuecong Xu and Jianfei Yang and Kezhi Mao and Lihua Xie and Jianxiong Yin and Simon See},
journal= {arXiv preprint arXiv:2109.12493},
year = {2021}
}
备注
11 pages, 7 figures