用于实时动作识别的轻量级网络架构
计算机视觉与模式识别
2019-05-22 v1 人工智能
机器学习
摘要
在这项工作中,我们提出了一种称为视频 Transformer 网络(VTN)的高效人体动作识别新方法。它利用了计算机视觉与自然语言处理的最新进展,并将其应用于视频理解。所提方法使我们能够创建轻量级 CNN 模型,仅使用 RGB 单目相机与通用 CPU 即可实现高精度与实时速度。此外,我们说明了如何通过从具有不同模态的多个模型蒸馏到单一模型来提升精度。我们与最先进方法进行了比较,并表明我们的方法在著名动作识别数据集上可与其中大多数方法媲美。我们使用现代推理框架对模型的推理时间进行了基准测试,并指出我们的方法在速度/精度权衡方面优于其他方法,在 CPU 上以 56 FPS 运行。模型与训练代码均已公开。
引用
@article{arxiv.1905.08711,
title = {Lightweight Network Architecture for Real-Time Action Recognition},
author = {Alexander Kozlov and Vadim Andronov and Yana Gritsenko},
journal= {arXiv preprint arXiv:1905.08711},
year = {2019}
}
备注
8 pages, 3 figures