AdaFocusV3:面向统一时空动态视频识别
计算机视觉与模式识别
2022-09-28 v1 人工智能
机器学习
摘要
近期研究揭示,降低时间冗余与空间冗余均为高效的视频识别途径,例如将大部分计算分配给与任务相关的部分帧或每帧中最有价值的图像区域。然而,在大多数现有工作中,通常只建模其中一种冗余而忽略另一种。本文基于近期提出的AdaFocusV2算法,探索时空动态计算的统一表述,从而贡献了一个改进的AdaFocusV3框架。我们的方法仅在一些小而具信息量的3D视频立方上激活昂贵的高容量网络,从而降低计算成本。这些立方从由帧高、帧宽和视频时长构成的空间中裁剪,而其位置由轻量级策略网络按样本自适应确定。在测试时,对应于每个视频的立方面数被动态配置,即视频立方被顺序处理直至产生足够可靠的预测。值得注意的是,AdaFocusV3可通过用深度特征插值近似不可微裁剪操作而有效训练。在六个基准数据集(即ActivityNet、FCVID、Mini-Kinetics、Something-Something V1&V2和Diving48)上的大量实证结果表明,我们的模型比有竞争力的基线高效得多。
引用
@article{arxiv.2209.13465,
title = {AdaFocusV3: On Unified Spatial-temporal Dynamic Video Recognition},
author = {Yulin Wang and Yang Yue and Xinhong Xu and Ali Hassani and Victor Kulikov and Nikita Orlov and Shiji Song and Humphrey Shi and Gao Huang},
journal= {arXiv preprint arXiv:2209.13465},
year = {2022}
}
备注
ECCV 2022