面向视频与体数据理解的并行可分离三维卷积
计算机视觉与模式识别
2018-09-13 v1
摘要
对于视频与体数据理解,三维卷积层在深度学习中被广泛使用,但代价是增加计算量与训练时间。近期工作试图以卷积块(例如 2D 与 1D 卷积层的结构化组合)替代三维卷积层。本文提出一种新颖的卷积块——并行可分离三维卷积(PmSCn),其沿不同维度应用 m 条并行流,每条流含 n 个 2D 卷积层与一个 1D 卷积层。我们首先通过张量分解从数学上论证以并行流(Pm)替代单个三维卷积层的必要性。接着我们将现代网络架构中常见的连续三维卷积层联合替换为多个 2D 卷积层(Cn)。最后,我们通过实验表明 PmSCn 可应用于不同骨干架构(如 ResNet、DenseNet 与 UNet)及不同任务(如视频动作识别、MRI 脑分割与电子显微镜分割)。在这三项应用中,我们将 SOTA 模型中的三维卷积层替换为 PmSCn,测试性能提升约 14%,模型大小平均缩减 40%。
引用
@article{arxiv.1809.04096,
title = {Parallel Separable 3D Convolution for Video and Volumetric Data Understanding},
author = {Felix Gonda and Donglai Wei and Toufiq Parag and Hanspeter Pfister},
journal= {arXiv preprint arXiv:1809.04096},
year = {2018}
}