面向动作识别的协同自监督视频表示学习
计算机视觉与模式识别
2025-02-03 v2
摘要
考虑到动作识别与人体姿态估计之间的紧密联系,我们通过联合纳入生成式姿态预测和判别式上下文匹配作为前置任务,设计了一个专门针对动作识别的协同自监督视频表示(CSVR)学习框架。具体而言,我们的CSVR包含三个分支:一个生成式姿态预测分支、一个判别式上下文匹配分支和一个视频生成分支。其中,第一个分支通过利用条件GAN预测未来帧的人体姿态来编码动态运动特征,第二个分支通过对比正负视频特征与I帧特征对来提取静态上下文特征。第三个分支旨在生成当前和未来的视频帧,以协同改进动态运动特征和静态上下文特征。大量实验表明,我们的方法在多个流行的视频数据集上达到了最先进的性能。
引用
@article{arxiv.2401.07584,
title = {Collaboratively Self-supervised Video Representation Learning for Action Recognition},
author = {Jie Zhang and Zhifan Wan and Lanqing Hu and Stephen Lin and Shuzhe Wu and Shiguang Shan},
journal= {arXiv preprint arXiv:2401.07584},
year = {2025}
}