中文

ApproxTrain:用于DNN训练与推理的近似乘法器快速仿真框架

硬件体系结构 2022-09-26 v3 人工智能 机器学习

摘要

深度神经网络(DNN)的端侧训练是持续学习的理想目标;然而,其受限于训练所需的巨大计算力。硬件近似乘法器在DNN推理加速器中已展现出获取资源效率的有效性;但使用近似乘法器进行训练尚少有探索。为构建支持DNN训练、采用近似乘法器的资源高效加速器,需对不同DNN架构与不同近似乘法器的训练收敛性与精度进行透彻评估。本文提出ApproxTrain,一个开源框架,可快速评估使用仿真近似乘法器的DNN训练与推理。ApproxTrain如TensorFlow(TF)般用户友好,仅需DNN架构的高层描述及近似乘法器的C/C++功能模型。我们通过GPU上新颖的基于LUT的近似浮点(FP)乘法器仿真器(AMSim)提升了乘法器级的仿真速度。ApproxTrain利用CUDA并将AMSim高效集成至TensorFlow库,以克服商用GPU缺乏原生硬件近似乘法器的问题。我们使用ApproxTrain在LeNets与ResNets架构上,针对小数据集与大数据集(含ImageNet)评估了近似乘法器DNN训练的收敛性与精度。评估显示相较于FP32与bfloat16乘法器,收敛行为相似且测试精度变化可忽略。相较于基于CPU的近似乘法器训练与推理仿真,GPU加速的ApproxTrain快2500倍以上。基于高度优化的闭源cuDNN/cuBLAS库与原生硬件乘法器,原版TensorFlow仅比ApproxTrain快8倍。

关键词

引用

@article{arxiv.2209.04161,
  title  = {ApproxTrain: Fast Simulation of Approximate Multipliers for DNN Training and Inference},
  author = {Jing Gong and Hassaan Saadat and Hasindu Gamaarachchi and Haris Javaid and Xiaobo Sharon Hu and Sri Parameswaran},
  journal= {arXiv preprint arXiv:2209.04161},
  year   = {2022}
}

备注

14 pages, 12 figures