时序蒸馏:面向视频中的少帧动作识别
计算机视觉与模式识别
2018-08-16 v1
摘要
视频分析即服务(VA SaaS)近年来快速增长。VA SaaS 通常由用户通过轻量级客户端访问。由于客户端与云之间的传输带宽通常有限且昂贵,设计具有有限数据传输需求的云端视频分析算法带来巨大益处。尽管已有大量研究致力于视频分析,但据我们所知,极少有关注 SaaS 中传输带宽限制的工作。作为该方向上的首次尝试,本文引入少帧动作识别问题,旨在训练与测试阶段均仅访问少数帧时保持高识别准确率。与先前处理密集帧的工作不同,我们提出时序蒸馏(TSD),将长视频序列蒸馏为极短序列以供传输。通过结合 3D CNN 进行视频动作识别的端到端训练,TSD 学习到视频帧紧凑且具有判别力的时空表示。在 Kinetics 数据集上,与最先进的视频动作识别算法 I3D 相比,TSD+I3D 通常仅需 50% 的帧数即可达到几乎相同的准确率。所提出的 TSD 具有三个突出优势。首先,TSD 具有轻量架构,可部署于客户端(如移动设备)以生成压缩的代表性帧,从而节省传输带宽。其次,TSD 显著减少了在云上使用压缩帧运行视频动作识别的计算量,同时保持高识别准确率。第三,TSD 可作为任意现有 3D CNN 的预处理模块插入。大量实验展示了 TSD 的有效性与特性。
引用
@article{arxiv.1808.05085,
title = {Temporal Sequence Distillation: Towards Few-Frame Action Recognition in Videos},
author = {Zhaoyang Zhang and Zhanghui Kuang and Ping Luo and Litong Feng and Wei Zhang},
journal= {arXiv preprint arXiv:1808.05085},
year = {2018}
}
备注
Accepted by ACM Multimedia