Arch-Net:用于架构无关模型部署的模型蒸馏
机器学习
2022-04-12 v2 计算机视觉与模式识别
摘要
深度神经网络对计算能力的巨大需求是其实际应用的主要障碍。许多近期的专用集成电路(ASIC)芯片具备用于神经网络加速的专用硬件支持。然而,由于ASIC的开发需要多年,它们不可避免地落后于神经网络架构研究的最新发展。例如,Transformer网络在许多流行芯片上没有原生支持,因此难以部署。在本文中,我们提出Arch-Net,一个仅由在大多数ASIC架构上被高效支持的算子构成的神经网络系列。当生成Arch-Net时,通过无标签的逐块模型蒸馏以渐进方式消除较不常见的网络结构(如层归一化和嵌入层),同时执行低于八位的量化以最大化性能。在机器翻译和图像分类任务上的实证结果证实,我们可以将最新开发的神经架构转化为快速运行且同样准确的Arch-Net,随时可在多种量产ASIC芯片上部署。代码将发布于 https://github.com/megvii-research/Arch-Net。
引用
@article{arxiv.2111.01135,
title = {Arch-Net: Model Distillation for Architecture Agnostic Model Deployment},
author = {Weixin Xu and Zipeng Feng and Shuangkang Fang and Song Yuan and Yi Yang and Shuchang Zhou},
journal= {arXiv preprint arXiv:2111.01135},
year = {2022}
}
备注
15 pages, 6 figures