基于多变换分类的自监督学习用于动作识别
计算机视觉与模式识别
2021-02-23 v1
摘要
自监督任务已被用于在标注不可用时构建可用于下游任务的有用表征。本文中,我们引入一种基于多变换分类的自监督视频表征学习方法,以高效分类人体动作。对多种变换的自监督学习不仅提供更丰富的上下文信息,还使视觉表征对变换更具鲁棒性。视频的时空表征通过分类七种不同的变换(即旋转、片段反转、置换、分割、合并变换、颜色切换、帧替换、噪声添加)以自监督方式学习。首先,对视频片段施加七种不同的视频变换。随后利用 3D 卷积神经网络提取片段特征,并处理这些特征以分类伪标签。我们将预训练任务中学得的模型用作预训练模型,并在下游任务中微调以识别人体动作。我们在 UCF101 和 HMDB51 数据集上,以 C3D 和 3D Resnet-18 为骨干网络进行了实验。实验结果表明,我们提出的框架优于其他 SOTA(最先进)自监督动作识别方法。代码将公开提供。
引用
@article{arxiv.2102.10378,
title = {Self-Supervised Learning via multi-Transformation Classification for Action Recognition},
author = {Duc Quang Vu and Ngan T. H. Le and Jia-Ching Wang},
journal= {arXiv preprint arXiv:2102.10378},
year = {2021}
}