用于自监督视频表征学习的静态与动态概念
计算机视觉与模式识别
2022-07-27 v1 机器学习
摘要
本文提出一种用于自监督视频表征学习的新型学习方案。受人类理解视频方式的启发,我们提出先学习通用视觉概念,再关注判别性局部区域以理解视频。具体而言,我们利用静态帧与帧差帮助解耦静态与动态概念,并分别在潜空间中对齐概念分布。我们加入多样性与保真度正则化以保证学到一组紧凑且有意义的的概念。随后我们采用交叉注意力机制聚合不同概念的详细局部特征,并过滤掉低激活的冗余概念以执行局部概念对比。大量实验表明,我们的方法提炼出有意义的静态与动态概念以引导视频理解,并在UCF-101、HMDB-51与Diving-48上取得最先进(SOTA)结果。
引用
@article{arxiv.2207.12795,
title = {Static and Dynamic Concepts for Self-supervised Video Representation Learning},
author = {Rui Qian and Shuangrui Ding and Xian Liu and Dahua Lin},
journal= {arXiv preprint arXiv:2207.12795},
year = {2022}
}
备注
ECCV 2022