中文

从网络图像到视频识别的注意力迁移

计算机视觉与模式识别 2017-08-04 v1 多媒体

摘要

训练基于深度学习的动作识别视频分类器需要大量带标签视频。标注过程劳动密集且耗时。另一方面,用户每天向互联网上传大量弱标签图像。为了利用丰富且高度多样化的网络图像集合,一种可扩展的方法是爬取这些图像来训练基于深度学习的分类器,例如卷积神经网络(CNN)。然而,由于域偏移问题,直接在视频上部署时,网络图像训练的深层分类器性能往往下降。解决该问题的一种方法是用视频微调训练好的模型,但仍需要足够数量的标注视频。本工作中,我们提出一种新颖的方法将知识从图像域迁移到视频域。所提方法能以有限数量的训练数据适应目标域(即视频数据)。我们的方法使用CNN的类判别空间注意力图将视频帧映射到低维特征空间。我们设计了一种新颖的Siamese EnergyNet结构,通过联合优化两个损失函数在注意力图上学习能量函数,使得对应于真实概念的注意力图具有更高能量。我们在两个具有挑战性的视频识别数据集(即TVHI和UCF101)上进行了大量实验,证明了所提方法的有效性。

关键词

引用

@article{arxiv.1708.00973,
  title  = {Attention Transfer from Web Images for Video Recognition},
  author = {Junnan Li and Yongkang Wong and Qi Zhao and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:1708.00973},
  year   = {2017}
}

备注

ACM Multimedia, 2017