用于视频动作识别的可泛化表示的多任务学习
计算机视觉与模式识别
2020-04-14 v2
摘要
在经典视频动作识别中,标签可能未包含关于多样视频外观与动态的足够信息,因此,在标准监督学习范式下训练的现有模型可能提取出泛化性较弱的特征。我们在跨数据集实验设置下评估这些模型,因为上述视频分析中的标签偏差问题在不同数据源间更为突出。我们发现,使用光流作为模型输入会损害大多数视频识别模型的泛化能力。基于这些发现,我们提出了一种用于视频分类的多任务学习范式。我们的核心思想是通过将数据作为自身监督或对数据施加监督约束来避免标签偏差并提升泛化能力。首先,我们将光流和RGB帧作为辅助监督,从而将我们的模型命名为逆向双流网络(Rev2Net)。进一步,我们通过向Rev2Net引入一个新的训练目标,称为解码差异惩罚(DDP),来协作辅助流预测任务和帧重建任务,该目标以自监督方式约束多任务特征的差异。Rev2Net在经典动作识别任务上被证明是有效的。它特别在跨数据集实验中展现出强大的泛化能力。
引用
@article{arxiv.1811.08362,
title = {Multi-Task Learning of Generalizable Representations for Video Action Recognition},
author = {Zhiyu Yao and Yunbo Wang and Mingsheng Long and Jianmin Wang and Philip S Yu and Jiaguang Sun},
journal= {arXiv preprint arXiv:1811.08362},
year = {2020}
}
备注
ICME 2020