FT K-means:GPU 上具有容错能力的高性能 K-means 算法
分布式、并行与集群计算
2024-08-09 v2 机器学习
摘要
K-means 是一种广泛使用的聚类算法,但其性能主要受限于距离计算的计算成本。现有实现对计算单元的利用率欠佳,且缺乏容错能力。为解决这些挑战,我们提出了 FT K-means,一种具有在线容错能力的高性能 GPU 加速 K-means 实现。我们首先提出了一种逐步优化策略,使其性能可与 NVIDIA 的 cuML 库相媲美。我们进一步通过一个基于模板的代码生成框架增强了 FT K-means,该框架支持不同的数据类型并适应不同的输入形状。我们提出了一种新颖的基于 warp 级张量核心的纠错方案,以解决复制操作期间因内存异步而导致的现有容错方法失效的问题。我们在 NVIDIA T4 和 A100 GPU 上的实验评估表明,在不启用容错功能时,FT K-means 的性能优于 cuML 的 K-means 实现,在非规则数据形状下性能提升达 10% 至 300%。此外,FT K-means 的容错功能仅引入 11% 的开销,即使在高错误注入率下也能保持稳健的性能。
引用
@article{arxiv.2408.01391,
title = {FT K-means: A High-Performance K-means on GPU with Fault Tolerance},
author = {Shixun Wu and Yitong Ding and Yujia Zhai and Jinyang Liu and Jiajun Huang and Zizhe Jian and Huangliang Dai and Sheng Di and Bryan M. Wong and Zizhong Chen and Franck Cappello},
journal= {arXiv preprint arXiv:2408.01391},
year = {2024}
}