Caffe Barista:在训练回路中用 FPGA 酿造 Caffe
分布式、并行与集群计算
2020-06-25 v1 机器学习
摘要
随着深度学习(DL)模型复杂度的增加,其计算需求也相应增长。部署卷积神经网络(CNN)包含两个阶段:训练和推理。由于推理任务通常在资源受限设备上执行,大量研究探索了在定制硬件加速器上进行低功耗推理的领域。另一方面,训练对计算和内存的需求都更高,主要在大规模数据中心中由高功耗 GPU 执行。基于 FPGA 的 CNN 训练是一个新兴的研究领域。这主要是由于缺乏易于原型化并部署各种硬件和/或算法技术以实现高能效 CNN 训练的工具。本工作提出 Barista,一种自动化工具流,可在流行的深度学习框架 Caffe 中无缝集成 FPGA 到 CNN 的训练中。据我们所知,这是唯一允许如此通用且快速部署用于基于 FPGA 的 CNN 训练的硬件与算法的工具,为进一步的研发提供了必要的基础设施。
引用
@article{arxiv.2006.13829,
title = {Caffe Barista: Brewing Caffe with FPGAs in the Training Loop},
author = {Diederik Adriaan Vink and Aditya Rajagopal and Stylianos I. Venieris and Christos-Savvas Bouganis},
journal= {arXiv preprint arXiv:2006.13829},
year = {2020}
}
备注
Published as short paper at FPL2020