Tensor Yard:面向硬件友好的卷积神经网络张量列分解一次性算法
计算机视觉与模式识别
2021-08-10 v1 硬件体系结构
摘要
如今深度学习已广泛应用于人类关注的许多经济、技术与科学领域。显然,基于深度神经网络的解决方案的效率不仅应考虑目标任务的 quality 指标,还应考虑延迟与目标平台设计的约束。在本文中,我们提出了一种面向硬件友好的卷积神经网络张量列(Tensor-Train)分解实现,以及 Tensor Yard——一种优化网络层分解阶数的一次性训练算法。这些思路可在不显著损失精度的情况下加速 Ascend 310 NPU 设备上的 ResNet 模型。例如,我们将 ResNet-101 加速了 14.6%,而 top-1 ImageNet 精度仅下降 0.5。
引用
@article{arxiv.2108.04029,
title = {Tensor Yard: One-Shot Algorithm of Hardware-Friendly Tensor-Train Decomposition for Convolutional Neural Networks},
author = {Anuar Taskynov and Vladimir Korviakov and Ivan Mazurenko and Yepan Xiong},
journal= {arXiv preprint arXiv:2108.04029},
year = {2021}
}
备注
10 pages, 5 figures, 1 table