中文

面向GPU的高性能与容错快速傅里叶变换——TurboFFT

分布式、并行与集群计算 2024-12-10 v1

摘要

GPU基于的快速傅里叶变换(FFT)对科学计算和信号处理至为重要。然而,我们发现现有FFT库效率低下且缺乏对软错误的容错。为此,我们引入TurboFFT,一个为高性能和在线容错共设计的新型FFT原型。对于FFT,我们提出了面向体系结构感知、无填充且基于模板的原型,以最大化硬件资源利用率,实现了与领先的专有库cuFFT相当或更好的性能。对于容错,我们1)在线程和线程块级别探索算法基础容错(ABFT),以减少额外的内存占用;2)通过引入双侧ABFT和位置编码来解决错误传播问题;3)进一步修改线程块级别的FFT,从1次事务改为多事务,以便为ABFT带来更多并行性。我们的双侧策略在无需额外全局内存的情况下实现在线纠错,而我们的多事务设计将ABFT中昂贵的线程块级别归约平均分配到零额外操作中。在NVIDIA A100服务器GPU和Tesla Turing T4 GPU上的实验结果表明,TurboFFT在无容错情况下的性能与cuFFT相当或快至300%,并超过VkFFT。即使在FP32和FP64下每分钟注入数十个错误,TurboFFT带有容错功能的性能仍仅增加7%至15%的开销。

关键词

引用

@article{arxiv.2412.05824,
  title  = {TurboFFT: Co-Designed High-Performance and Fault-Tolerant Fast Fourier Transform on GPUs},
  author = {Shixun Wu and Yujia Zhai and Jinyang Liu and Jiajun Huang and Zizhe Jian and Huangliang Dai and Sheng Di and Franck Cappello and Zizhong Chen},
  journal= {arXiv preprint arXiv:2412.05824},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2405.02520