探索Nekbone在可重构架构上的加速
分布式、并行与集群计算
2020-11-11 v1
摘要
硬件技术进步正艰难地追赶科学雄心,一个关键问题是我们如何能更有效地利用已有的晶体管。对于高性能计算(HPC)而言尤其如此,其倾向往往是向问题堆砌算力,而代码本身至少在某种程度上常受其他因素制约。通过重新设计算法并从冯·诺依曼式转向数据流风格,相较于更通用的架构,在可重构架构上或许有更多机会解决这些瓶颈。本文中,我们探索将广泛流行的HPC迷你应用Nekbone的AX核通过Vitis使用高层次综合移植到FPGA上。虽然计算是该代码的重要部分,但它在CPU上同样受内存限制,关键在于能否借助FPGA缓解此问题。我们首先探索了获取良好性能的优化策略,在FPGA上我们核的首版与终版间运行时差超过4000倍。随后,我们在Alveo U280上的性能与功耗效率对比了24核Xeon Platinum CPU和NVIDIA V100 GPU,FPGA性能约为CPU的4倍,达到GPU性能的近四分之三,且比两者都显著更节能。本工作的成果是一组对比与方法,既专门适用于FPGA上的Nekbone,也对可重构架构上加速HPC代码具有更广泛的意义。
引用
@article{arxiv.2011.04981,
title = {Exploring the acceleration of Nekbone on reconfigurable architectures},
author = {Nick Brown},
journal= {arXiv preprint arXiv:2011.04981},
year = {2020}
}
备注
Pre-print of paper accepted to IEEE/ACM International Workshop on Heterogeneous High-performance Reconfigurable Computing (H2RC)