在多小核开源RISC-V平台上优化基础模型推理
分布式、并行与集群计算
2024-05-30 v1 人工智能
硬件体系结构
摘要
基于Transformer的基础模型已成为多个领域的关键,尤其是自然语言处理(NLP)或计算机视觉(CV)。这些模型主要部署在高性能GPU或具有高度定制专有指令集的硬连线加速器上。迄今为止,对基于RISC-V的通用平台的关注有限。在我们的工作中,我们首次展示了在开源多小核RISC-V平台上Transformer模型的端到端推理结果,该平台实现了分布式Softmax原语,并利用ISA扩展实现SIMD浮点操作数流和指令重复,以及专用DMA引擎以最小化昂贵的主存访问并容忍其延迟。我们关注两种基础Transformer拓扑:仅编码器和仅解码器模型。对于仅编码器模型,我们展示了从最优化实现到基线版本高达12.8倍的加速。我们达到超过79%的FPU利用率和294 GFLOPS/W,利用硬件平台比最先进(SoA)加速器高出2倍以上,同时每个计算单元实现相当的吞吐量。对于仅解码器拓扑,与非自回归(NAR)模式相比,我们实现了16.1倍加速,与自回归(AR)模式相比,基线实现加速高达35.6倍。与最好的SoA专用加速器相比,我们实现了2.04倍更高的FPU利用率。
引用
@article{arxiv.2405.19284,
title = {Optimizing Foundation Model Inference on a Many-tiny-core Open-source RISC-V Platform},
author = {Viviane Potocnik and Luca Colagrande and Tim Fischer and Luca Bertaccini and Daniele Jahier Pagliari and Alessio Burrello and Luca Benini},
journal= {arXiv preprint arXiv:2405.19284},
year = {2024}
}
备注
14 pages, 10 figures, 4 tables, IEEE Transactions on Circuits and Systems for Artificial Intelligence