多即少:通过大—小网络与深度可分离时间聚合学习高效视频表征
计算机视觉与模式识别
2021-07-27 v1
摘要
当前视频动作识别的最优模型多基于昂贵的 3D 卷积网络。这导致需要大型 GPU 集群来训练与评估此类架构。为解决该问题,我们提出一种轻量且省内存的动作识别架构,仅使用一小部分资源即可达到或优于当前架构。所提架构结合处理低分辨率帧的深度子网络与处理高分辨率帧的紧凑子网络,从而同时实现高效率与高精度。我们证明,相较基线,我们的方法在 FLOPs 上减少 倍,内存占用减少约 倍。这使得在相同计算预算下可用更多输入帧训练更深模型。为进一步免除对大规模 3D 卷积的需求,提出一种时间聚合模块,以极小的额外计算代价建模视频中的时间依赖关系。我们的模型在包括 Kinetics、Something-Something 与 Moments-in-time 在内的多个动作识别基准上取得强劲表现。代码与模型见 https://github.com/IBM/bLVNet-TAM。
引用
@article{arxiv.1912.00869,
title = {More Is Less: Learning Efficient Video Representations by Big-Little Network and Depthwise Temporal Aggregation},
author = {Quanfu Fan and Chun-Fu Chen and Hilde Kuehne and Marco Pistoia and David Cox},
journal= {arXiv preprint arXiv:1912.00869},
year = {2021}
}
备注
Accepted at NeurIPS 2019, codes and models are available at https://github.com/IBM/bLVNet-TAM