三元残差网络
信息论
2017-11-01 v2 人工智能
math.IT
摘要
尽管在低位精度下进行了严格的(再)训练,DNN的亚8位表示仍会导致一些可察觉的精度损失。这种精度损失本质上使它们等同于一个浅得多的对应网络,削弱了作为深度网络的能力。为解决这一精度下降问题,我们引入了残差网络的概念,即向亚8位网络的敏感分支添加更多低位精度边以补偿损失的精度。此外,我们提出一种扰动理论来识别此类敏感边。借助这种精度与计算之间优雅的权衡,8-2模型(8位激活值,三元权重)通过三元残差边增强,在基于ImageNet数据集预训练的最先进深度网络ResNet-101上,尽管模型大小减少约1.6倍、乘法次数减少约26倍、相比8-8表示潜在功耗性能提升约2倍,仍能达到极高精度(距我们的FP-32基线约1%的下降)。此外,根据动态环境中变化的精度需求,部署的低位精度模型可以通过部分启用/禁用残差连接实时升级/降级。例如,在上述增强网络中禁用最不重要的残差连接,精度下降为约2%(相对FP32),尽管模型大小减少约1.9倍、乘法次数减少约32倍、相比8-8表示潜在功耗性能提升约2.3倍。最后,所有三元连接本质上是稀疏的,且三元残差转换可以在资源受限环境下完成,无需低位精度(再)训练。
引用
@article{arxiv.1707.04679,
title = {Ternary Residual Networks},
author = {Abhisek Kundu and Kunal Banerjee and Naveen Mellempudi and Dheevatsa Mudigere and Dipankar Das and Bharat Kaul and Pradeep Dubey},
journal= {arXiv preprint arXiv:1707.04679},
year = {2017}
}