中文

通过动作-表观对齐元适应的无监督少样本动作识别

计算机视觉与模式识别 2021-10-12 v2 人工智能 机器学习

摘要

我们提出MetaUVFS,作为首个用于视频少样本动作识别的无监督元学习算法。MetaUVFS利用超过55万段无标签视频,通过对比学习训练一个双流2D与3D CNN架构,分别捕捉表观特定的空间特征与动作特定的时空视频特征。MetaUVFS包含一种新颖的动作-表观对齐元适应(A3M)模块,该模块通过在无监督困难挖掘的片段上进行显式少样本情景元学习,学会相对于表观特征关注动作导向的视频特征。我们的动作-表观对齐与显式少样本学习器使无监督训练条件模拟下游少样本任务,使MetaUVFS在少样本基准上显著优于所有无监督方法。此外,不同于以往有监督的少样本动作识别方法,MetaUVFS既不需要基类标签,也不需要有监督预训练骨干。因此,我们只需训练一次MetaUVFS,即可在流行的HMDB51、UCF101和Kinetics100少样本数据集上与SOTA有监督方法竞争,有时甚至优于后者。

关键词

引用

@article{arxiv.2109.15317,
  title  = {Unsupervised Few-Shot Action Recognition via Action-Appearance Aligned Meta-Adaptation},
  author = {Jay Patravali and Gaurav Mittal and Ye Yu and Fuxin Li and Mei Chen},
  journal= {arXiv preprint arXiv:2109.15317},
  year   = {2021}
}

备注

ICCV 2021 (Oral)