基于多数据集训练的Transformer用于鲁棒动作识别
计算机视觉与模式识别
2022-11-28 v4
摘要
我们研究鲁棒特征表示任务,旨在针对动作识别在多个数据集上良好泛化。我们基于Transformer构建方法,因其有效性。尽管过去十年视频动作识别取得了巨大进展,如何训练一个在多个数据集上均表现良好的单一模型仍具挑战且很有价值。本文提出一种新颖的多数据集训练范式MultiTrain,设计了两个新损失项,即信息损失和投影损失,以学习用于动作识别的鲁棒表示。具体而言,信息损失最大化特征嵌入的表达能力,而各数据集的投影损失挖掘跨数据集类别间的内在关系。我们在五个具有挑战性的数据集Kinetics-400、Kinetics-700、Moments-in-Time、Activitynet和Something-something-v2上验证了方法的有效性。大量实验结果表明,我们的方法能持续提升最先进性能。代码与模型已发布。
引用
@article{arxiv.2209.12362,
title = {Multi-dataset Training of Transformers for Robust Action Recognition},
author = {Junwei Liang and Enwei Zhang and Jun Zhang and Chunhua Shen},
journal= {arXiv preprint arXiv:2209.12362},
year = {2022}
}
备注
NeurIPS 2022 Spotlight paper. Supplementary material at https://openreview.net/forum?id=aGFQDrNb-KO. Code and models are available at https://github.com/JunweiLiang/MultiTrain