GPU上具备容错性的高性能快速傅里叶变换——TurboFFT
分布式、并行与集群计算
2024-05-07 v1
摘要
快速傅里叶变换(FFT)作为众多科学应用的核心计算,正日益面临可靠性问题。本文介绍TurboFFT,这是一种具备双侧校验方案的高性能FFT实现,能够高效检测和纠正计算单元中的静默数据损坏。 proposed的双侧校验通过对输入信号进行不同线性组合编码,既允许快速批量错误检测,也可以在计算过程中进行错误纠正,而无需重新计算。我们在内核、线程和线程块级别探索了双侧校验设计,提供的基线FFT实现与领先的闭源cuFFT竞争。我们演示了一种内核融合策略,以抵消容错引入的计算/内存开销。我们提出基于模板的代码生成策略,以降低开发成本并支持广泛的输入尺寸和数据类型。在NVIDIA A100服务器GPU和Tesla Turing T4 GPU上的实验结果表明,TurboFFT在性能上与闭源库cuFFT相当或更优。即使在每分钟数百次错误注入下,TurboFFT仅比cuFFT增加最小开销(平均7%至15%),适用于单精度和双精度。TurboFFT比现有容错FFT方案提高了23%。
引用
@article{arxiv.2405.02520,
title = {TurboFFT: A High-Performance Fast Fourier Transform with Fault Tolerance on GPU},
author = {Shixun Wu and Yujia Zhai and Jinyang Liu and Jiajun Huang and Zizhe Jian and Huangliang Dai and Sheng Di and Zizhong Chen and Franck Cappello},
journal= {arXiv preprint arXiv:2405.02520},
year = {2024}
}