面向GPU的高性能与容错快速傅里叶变换——TurboFFT
分布式、并行与集群计算
2024-12-10 v1
摘要
GPU基于的快速傅里叶变换(FFT)对科学计算和信号处理至为重要。然而,我们发现现有FFT库效率低下且缺乏对软错误的容错。为此,我们引入TurboFFT,一个为高性能和在线容错共设计的新型FFT原型。对于FFT,我们提出了面向体系结构感知、无填充且基于模板的原型,以最大化硬件资源利用率,实现了与领先的专有库cuFFT相当或更好的性能。对于容错,我们1)在线程和线程块级别探索算法基础容错(ABFT),以减少额外的内存占用;2)通过引入双侧ABFT和位置编码来解决错误传播问题;3)进一步修改线程块级别的FFT,从1次事务改为多事务,以便为ABFT带来更多并行性。我们的双侧策略在无需额外全局内存的情况下实现在线纠错,而我们的多事务设计将ABFT中昂贵的线程块级别归约平均分配到零额外操作中。在NVIDIA A100服务器GPU和Tesla Turing T4 GPU上的实验结果表明,TurboFFT在无容错情况下的性能与cuFFT相当或快至300%,并超过VkFFT。即使在FP32和FP64下每分钟注入数十个错误,TurboFFT带有容错功能的性能仍仅增加7%至15%的开销。
引用
@article{arxiv.2412.05824,
title = {TurboFFT: Co-Designed High-Performance and Fault-Tolerant Fast Fourier Transform on GPUs},
author = {Shixun Wu and Yujia Zhai and Jinyang Liu and Jiajun Huang and Zizhe Jian and Huangliang Dai and Sheng Di and Franck Cappello and Zizhong Chen},
journal= {arXiv preprint arXiv:2412.05824},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2405.02520