SmallBigNet:融合核心与上下文视图的视频分类网络
计算机视觉与模式识别
2020-06-26 v1
摘要
时序卷积已广泛用于视频分类。然而,它在有限视图下的时空上下文中执行,常削弱其学习视频表示的能力。为缓解该问题,我们提出一种简洁新颖的 SmallBig 网络,协同小视图与大视图。对于当前时间步,小视图分支用于学习核心语义,而大视图分支用于捕获上下文语义。与传统时序卷积不同,大视图分支可从更宽的 3D 感受野为小视图分支提供最具激活性的视频特征。通过聚合此类大视图上下文,小视图分支能学习更鲁棒且更具判别力的时空表示用于视频分类。此外,我们提出在小视图与大视图分支间共享卷积,这提升了模型紧凑性并缓解过拟合。因此,我们的 SmallBigNet 取得了类似 2D CNN 的模型规模,同时获得了如 3D CNN 般的精度提升。我们在大规模视频基准(如 Kinetics400、Something-Something V1 和 V2)上进行了充分实验。我们的 SmallBig 网络在精度和/或效率上优于若干近期最先进方法。代码与模型将发布于 https://github.com/xhl-video/SmallBigNet。
引用
@article{arxiv.2006.14582,
title = {SmallBigNet: Integrating Core and Contextual Views for Video Classification},
author = {Xianhang Li and Yali Wang and Zhipeng Zhou and Yu Qiao},
journal= {arXiv preprint arXiv:2006.14582},
year = {2020}
}
备注
CVPR2020