LP-3DCNN:在三维卷积神经网络中揭示局部相位
计算机视觉与模式识别
2019-04-09 v1
摘要
传统的三维卷积神经网络(CNNs)计算代价高、内存消耗大、易于过拟合,且最重要的是需要提升其特征学习能力。为解决这些问题,我们提出整流局部相位体(ReLPV)模块,作为标准三维卷积层的高效替代。ReLPV 模块在输入图每个位置的三维局部邻域(如 3x3x3)中提取相位以获得特征图。相位是通过在每个位置的三维局部邻域中多个固定低频点计算三维短时傅里叶变换(STFT)来提取的。这些在不同频率点的特征图在通过激活函数后线性组合。与滤波器尺寸分别为 3x3x3 到 13x13x13 的标准三维卷积层相比,ReLPV 模块显著节省参数,至少达 3^3 到 13^3 倍。我们表明 ReLPV 模块的特征学习能力显著优于标准三维卷积层。此外,它在不同三维数据表示上均产生一致更好的结果。我们在体素化的 ModelNet10 和 ModelNet40 数据集上取得了当前最优(state-of-the-art)精度,同时仅使用了当前最优方法 11% 的参数。我们还在 UCF-101 split-1 动作识别数据集上将最优结果提升了 5.68%(从头训练时),同时仅使用最优方法 15% 的参数。项目主页位于 https://sites.google.com/view/lp-3dcnn/home。
引用
@article{arxiv.1904.03498,
title = {LP-3DCNN: Unveiling Local Phase in 3D Convolutional Neural Networks},
author = {Sudhakar Kumawat and Shanmuganathan Raman},
journal= {arXiv preprint arXiv:1904.03498},
year = {2019}
}
备注
Accepted in CVPR 2019