通过预测时空显著性进行单图像动作识别
计算机视觉与模式识别
2017-05-15 v1
摘要
我们提出了一种基于深度卷积神经网络(CNN)的新方法,通过预测未来运动并检测图像显著部分的形状和位置,来识别静态图像中的人体动作。我们对这一重要研究领域做出以下主要贡献:(i) 我们利用静态图像中预测的未来运动(Walker等, 2015)作为补偿缺失时间信息的手段,同时利用显著性图以预测为显著内容的位置和形状形式表示空间信息。(ii) 我们通过迁移学习将静态图像中的动作分类视为域适应问题。我们首先将输入的静态图像映射到一个称为预测光流-显著性图域(POF-SM)的新域,然后微调在ImageNet数据集上训练的深度CNN模型的各层,以在POF-SM域中执行动作分类。(iii) 我们在流行的Willow数据集上测试了我们的方法。但与现有方法不同,我们还在更具现实性和挑战性的、包含超过2M静态图像的数据集上进行了测试,该数据集通过从UCF-101视频数据集中抽取随机帧并标注而构建。我们将该数据集称为UCF静态图像数据集,简称UCFSI-101。我们的结果优于当前最先进水平。
引用
@article{arxiv.1705.04641,
title = {Single Image Action Recognition by Predicting Space-Time Saliency},
author = {Marjaneh Safaei and Hassan Foroosh},
journal= {arXiv preprint arXiv:1705.04641},
year = {2017}
}