中文

用于动作识别的深度图像到视频自适应与融合网络

计算机视觉与模式识别 2020-02-19 v1

摘要

现有的视频动作识别深度学习方法需要大量标注视频进行训练,这既费力又耗时。对于同一动作,从不同媒体类型(如视频和图像)学到的知识可能是相关且互补的。然而,由于视频与图像之间的域偏移和异构特征表示,在图像上训练的分类器直接用于视频时性能可能急剧下降。本文提出一种新方法,称为深度图像到视频自适应与融合网络(DIVAFN),以视频关键帧为桥梁,通过从图像迁移知识来增强视频动作识别。DIVAFN 是一个统一的深度学习模型,将域不变表示学习与跨模态特征融合集成到统一优化框架中。具体而言,我们设计了一种高效的跨模态相似性度量,以减小图像、关键帧和视频之间的模态偏移。然后,我们采用自动编码器架构,其隐藏层被约束为动作类名的语义表示。这样,当采用自动编码器将不同域学到的特征投影到同一空间时,可获得更紧凑、更具信息量和判别性的表示。最后,将这三个自动编码器学到的语义特征表示拼接起来用于训练视频动作识别的分类器。在四个真实数据集上的综合实验表明,我们的方法优于一些最先进的域自适应和动作识别方法。

关键词

引用

@article{arxiv.1911.10751,
  title  = {Deep Image-to-Video Adaptation and Fusion Networks for Action Recognition},
  author = {Yang Liu and Zhaoyang Lu and Jing Li and Tao Yang and Chao Yao},
  journal= {arXiv preprint arXiv:1911.10751},
  year   = {2020}
}

备注

Accepted by IEEE Transactions on Image Processing, codes can be found at https://yangliu9208.github.io/DIVAFN/