中文

核分离转置卷积操作

机器学习 2022-10-14 v3 人工智能

摘要

转置卷积已在许多深度学习应用中展现出重要性。然而,由于在每个行与列的每个元素后补零导致特征图尺寸增大,转置卷积层计算密集。因此,在扩展后的输入特征图上的卷积操作导致硬件资源利用率低下。不必要乘法操作的主要原因在于输入特征图中预定义位置的零。我们提出一种算法级优化技术以有效实现转置卷积来解决这些问题。基于核激活,我们将原始核分离为四个子核。该方案可减少内存需求与不必要的乘法。我们提出的方法使用来自 Kaggle 网站的花朵数据集,在 Titan X GPU(Intel 双核 CPU)上实现了 3.09(3.02)×3.09 (3.02) \times 更快的计算。此外,所提优化方法可推广至现有设备而无需额外硬件需求。使用一个含单层转置卷积层的简单深度学习模型来评估该优化方法。在 Intel 双核 CPU 上,使用 MNIST 数据集相比常规实现展现了 2.2×2.2 \times 更快的训练。

关键词

引用

@article{arxiv.2209.03704,
  title  = {Kernel-Segregated Transpose Convolution Operation},
  author = {Vijay Srinivas Tida and Sai Venkatesh Chilukoti and Xiali Hei and Sonya Hsu},
  journal= {arXiv preprint arXiv:2209.03704},
  year   = {2022}
}