X3D:用于高效视频识别的扩展架构
计算机视觉与模式识别
2020-04-10 v1
摘要
本文提出 X3D,一系列高效视频网络,其沿多个网络轴(空间、时间、宽度与深度)逐步扩展微小的 2D 图像分类架构。受机器学习中特征选择方法启发,采用简单的逐步网络扩展方法,每步扩展单一轴,从而实现良好的精度-复杂度权衡。为将 X3D 扩展到特定目标复杂度,我们执行渐进式前向扩展,随后后向收缩。X3D 取得 SOTA 性能,同时在相似精度下比较先前工作仅需 4.8 倍和 5.5 倍更少的乘加运算与参数。最令人惊讶的发现是,具有高时空分辨率的网络可表现良好,同时网络宽度与参数极少。我们在视频分类与检测基准上以空前效率报告了具竞争力的精度。代码将发布于:https://github.com/facebookresearch/SlowFast
引用
@article{arxiv.2004.04730,
title = {X3D: Expanding Architectures for Efficient Video Recognition},
author = {Christoph Feichtenhofer},
journal= {arXiv preprint arXiv:2004.04730},
year = {2020}
}
备注
CVPR 2020 (Oral)