OCSampler:通过单步采样将视频压缩为单片段
计算机视觉与模式识别
2022-01-13 v1
摘要
本文提出一种名为 OCSampler 的框架,以探索用一段短片段表示视频的紧凑且有效的视频表征,用于高效视频识别。近期工作倾向于将帧采样建模为顺序决策任务,依据重要性逐帧选取,而我们提出了一种学习实例特定视频浓缩策略的新范式,仅通过单步即可选取信息帧来表示整个视频。我们的基本动机在于,高效视频识别任务在于一次性处理整个序列,而非顺序挑取帧。相应地,这些策略由轻量级略读网络与一个简单的但有效的策略网络在单步内导出。此外,我们以帧数预算扩展了所提方法,使框架能以尽可能少的帧在高置信度下给出正确预测。在 ActivityNet、Mini-Kinetics、FCVID、Mini-Sports1M 四个基准上的实验证明了我们的 OCSampler 在准确率、理论计算开销、实际推理速度上优于以往方法。我们还评估了其在不同分类器、采样帧和搜索空间下的泛化能力。特别地,我们在 ActivityNet 上以令人印象深刻的吞吐量(单块 TITAN Xp GPU 上 123.9 视频/秒)取得了 76.9% mAP 与 21.7 GFLOPs。
引用
@article{arxiv.2201.04388,
title = {OCSampler: Compressing Videos to One Clip with Single-step Sampling},
author = {Jintao Lin and Haodong Duan and Kai Chen and Dahua Lin and Limin Wang},
journal= {arXiv preprint arXiv:2201.04388},
year = {2022}
}
备注
Video Understanding, Efficient Action Recognition