用于视频高效动作识别的动态采样网络
计算机视觉与模式识别
2020-08-26 v1
摘要
现有的动作识别方法主要基于片段级分类器,如双流CNN或3D CNN,其从随机选择的片段训练并在测试时对密集采样的片段应用。然而,这一标准设定对于训练分类器可能是次优的,并且在实践中部署时需要巨大的计算开销。为解决这些问题,我们提出一种用于视频动作识别的新框架,称为动态采样网络(DSN,Dynamic Sampling Networks),通过设计动态采样模块来提升所学片段级分类器的判别力,并提高测试时的推理效率。具体而言,DSN由一个采样模块和一个分类模块组成,其目标分别是学习采样策略以在线选择保留哪些片段,以及训练片段级分类器基于这些所选片段执行动作识别。特别地,给定输入视频,我们在关联强化学习设定下训练一个观测网络,以最大化具有正确预测的所选片段的奖励。我们在四个动作识别数据集(UCF101、HMDB51、THUMOS14和ActivityNet v1.3)上进行大量实验以研究DSN框架的不同方面。实验结果表明,DSN仅使用不到一半的片段即可大幅提升推理效率,且仍能获得略优于或与最先进方法相当的动作识别精度。
引用
@article{arxiv.2006.15560,
title = {Dynamic Sampling Networks for Efficient Action Recognition in Videos},
author = {Yin-Dong Zheng and Zhaoyang Liu and Tong Lu and Limin Wang},
journal= {arXiv preprint arXiv:2006.15560},
year = {2020}
}
备注
To appear in IEEE Transaction on Image Processing