中文

事半功倍:利用网络动作图像训练CNN进行动作识别

计算机视觉与模式识别 2015-12-23 v1

摘要

最近,尝试收集数百万视频来训练CNN模型用于视频动作识别。然而,策划如此大规模视频数据集需要巨大人力,且在数百万视频上训练CNN需要巨大计算资源。相反,从网络收集动作图像更容易,且在图像上训练需要更少计算。此外,标注的网络图像往往包含有判别性的动作姿态,突出视频时间进程的判别部分。我们探索是否可利用网络动作图像训练更好的CNN模型用于视频动作识别。我们从网络收集23.8K手动过滤的图像,描绘UCF101动作视频数据集中的101个动作。我们展示在训练中利用网络动作图像与视频结合,可实现CNN模型性能的显著提升。然后我们通过利用爬取的网络图像(未过滤)对UCF101和ActivityNet研究该过程的可扩展性。我们用393K未过滤图像替换16.2M视频帧并获得可比性能。

关键词

引用

@article{arxiv.1512.07155,
  title  = {Do Less and Achieve More: Training CNNs for Action Recognition Utilizing Action Images from the Web},
  author = {Shugao Ma and Sarah Adel Bargal and Jianming Zhang and Leonid Sigal and Stan Sclaroff},
  journal= {arXiv preprint arXiv:1512.07155},
  year   = {2015}
}