深度神经网络中通过集体张量分解共享残差单元
计算机视觉与模式识别
2017-03-16 v2
摘要
残差单元被广泛用于缓解构建深度神经网络时的优化困难。然而,性能提升并不能很好地补偿模型尺寸的增加,这表明这些残差单元的参数效率较低。在这项工作中,我们首先重新审视了几种残差单元变体中的残差函数,并证明这些残差函数实际上可以用一个基于广义块项分解的统一框架来解释。然后,基于这一新解释,我们提出了一种新的架构——集体残差单元(CRU),它通过集体张量分解增强了深度神经网络的参数效率。CRU利用共享因子实现了不同残差单元之间的知识共享。实验结果表明,我们提出的CRU网络展示了出色的参数效率,以ResNet-50的模型尺寸达到了与ResNet-200相当的分类性能。通过使用CRU构建更深的网络,我们可以在ImageNet-1k和Places365-Standard基准数据集上实现最先进的单模型分类准确率。(代码和训练模型可在GitHub上获取)
引用
@article{arxiv.1703.02180,
title = {Sharing Residual Units Through Collective Tensor Factorization in Deep Neural Networks},
author = {Chen Yunpeng and Jin Xiaojie and Kang Bingyi and Feng Jiashi and Yan Shuicheng},
journal= {arXiv preprint arXiv:1703.02180},
year = {2017}
}