DTG-Net:差异化教师引导的自监督视频动作识别
计算机视觉与模式识别
2020-06-16 v1
摘要
具有复杂网络架构的最先进的视频动作识别模型已取得显著改进,但这些模型严重依赖大规模、高质量标注的数据集。为减少这种依赖,我们提出了一种自监督师生架构,即差异化教师引导的自监督网络(DTG-Net)。在 DTG-Net 中,除了通过自监督学习(SSL)减少对标注数据的依赖外,预训练的动作相关模型被用作教师引导,提供先验知识以减轻 SSL 中对大量未标注视频的需求。具体而言,利用在动作相关任务(例如图像分类、基于图像的动作识别)上多年的研究积累,DTG-Net 在多种教师引导(即那些训练良好的动作相关任务模型)下学习自监督视频表示。同时,DTG-Net 以对比自监督学习的方式进行优化。当从同一视频或不同视频中随机采样两个图像序列分别作为正样本对或负样本对时,它们随后被送入教师和学生网络进行特征嵌入。之后,对比特征一致性被定义为每对样本特征嵌入之间的一致性,即正样本对一致,负样本对不一致。同时,为反映不同教师任务的不同引导作用,我们还探索了对教师任务施加不同的加权引导。最后,DTG-Net 通过两种方式进行评估:(i) 使用仅含无标注视频的自监督 DTG-Net 来预训练有监督的动作识别模型;(ii) 以端到端的方式将有监督的 DTG-Net 与有监督的动作网络联合训练。其性能优于大多数预训练方法,并且与有监督的动作识别方法相比也具有出色的竞争力。
引用
@article{arxiv.2006.07609,
title = {DTG-Net: Differentiated Teachers Guided Self-Supervised Video Action Recognition},
author = {Ziming Liu and Guangyu Gao and A. K. Qin and Jinyang Li},
journal= {arXiv preprint arXiv:2006.07609},
year = {2020}
}