中文

用于少样本视频识别的深度引导自适应元融合网络

计算机视觉与模式识别 2020-10-21 v1

摘要

人类仅给定少量样本即可轻松识别动作,而现有的视频识别模型仍严重依赖大规模标注数据输入。这一观察激发了人们对少样本视频动作识别的日益关注,其旨在仅用极少标注样本学习新动作。本文提出一种用于少样本视频识别的深度引导自适应元融合网络,称为 AMeFu-Net。具体而言,我们从三方面解决少样本识别问题:首先,通过引入深度信息作为场景载体来缓解极度数据稀缺问题,这为模型带来额外视觉信息;其次,我们将原始 RGB 片段的表示与由时间异步增强机制采样的多个非严格对应深度片段相融合,在特征层面合成新实例;第三,提出一种新颖的深度引导自适应实例归一化(DGAdaIN)融合模块以高效融合双流模态。此外,为更好地模拟少样本识别过程,我们的模型以元学习方式训练。在多个动作识别基准上的大量实验证明了模型的有效性。

关键词

引用

@article{arxiv.2010.09982,
  title  = {Depth Guided Adaptive Meta-Fusion Network for Few-shot Video Recognition},
  author = {Yuqian Fu and Li Zhang and Junke Wang and Yanwei Fu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2010.09982},
  year   = {2020}
}

备注

accepted by ACM Multimedia 2020