中文

在多小核开源RISC-V平台上优化基础模型推理

分布式、并行与集群计算 2024-05-30 v1 人工智能 硬件体系结构

摘要

基于Transformer的基础模型已成为多个领域的关键,尤其是自然语言处理(NLP)或计算机视觉(CV)。这些模型主要部署在高性能GPU或具有高度定制专有指令集的硬连线加速器上。迄今为止,对基于RISC-V的通用平台的关注有限。在我们的工作中,我们首次展示了在开源多小核RISC-V平台上Transformer模型的端到端推理结果,该平台实现了分布式Softmax原语,并利用ISA扩展实现SIMD浮点操作数流和指令重复,以及专用DMA引擎以最小化昂贵的主存访问并容忍其延迟。我们关注两种基础Transformer拓扑:仅编码器和仅解码器模型。对于仅编码器模型,我们展示了从最优化实现到基线版本高达12.8倍的加速。我们达到超过79%的FPU利用率和294 GFLOPS/W,利用硬件平台比最先进(SoA)加速器高出2倍以上,同时每个计算单元实现相当的吞吐量。对于仅解码器拓扑,与非自回归(NAR)模式相比,我们实现了16.1倍加速,与自回归(AR)模式相比,基线实现加速高达35.6倍。与最好的SoA专用加速器相比,我们实现了2.04倍更高的FPU利用率。

关键词

引用

@article{arxiv.2405.19284,
  title  = {Optimizing Foundation Model Inference on a Many-tiny-core Open-source RISC-V Platform},
  author = {Viviane Potocnik and Luca Colagrande and Tim Fischer and Luca Bertaccini and Daniele Jahier Pagliari and Alessio Burrello and Luca Benini},
  journal= {arXiv preprint arXiv:2405.19284},
  year   = {2024}
}

备注

14 pages, 10 figures, 4 tables, IEEE Transactions on Circuits and Systems for Artificial Intelligence