中文

分布式数据并行 ML 训练中 GPU TEE 开销的特征化

密码学与安全 2025-08-15 v3 分布式、并行与集群计算

摘要

保密计算 (CC) 或受信任执行封闭区 (TEEs) 现在是实现云端安全计算的最常见方法。NVIDIA 最近引入的 GPU TEE 使机器学习 (ML) 模型能够在不泄露模型权重或数据给云提供商的条件下进行训练。然而,使用 GPU TEE 进行 ML 训练的潜在性能影响尚未得到充分特征化。在本工作中,我们提出了对运行分布式数据并行 (DDP) ML 训练中 GPU 受信任执行封闭区性能开销的深入特征化研究。我们的研究揭示了 DDP 训练在 GPU TEE 中的性能挑战。DDP 使用环形 all-reduce,这是一种众所周知的方法,用于来自多个设备的梯度聚合。环形 all-reduce 由多个 scatter-reduce 和 all-gather 操作组成。在 GPU TEE 中,只有 GPU 包(GPU 和 HBM 内存)是受信任的。因此,必须对通信到 GPU 包之外的数据进行加密和身份验证,以确保其保密性和完整性。因此,环形 all-reduce 的每个阶段都需要来自发送方的加密和消息身份验证码 (MAC) 生成,以及来自接收方的解密和 MAC 验证。随着参与 DDP 的 GPU 数量增加,受信任 GPU 之间的安全通信开销在环形 all-reduce 中按比例增长。此外,更大的模型导致更多的异步 all-reduce 操作,加剧了通信成本。我们的结果显示,在四个 GPU TEE 中,具体取决于正在训练的模型,每个训练迭代的运行时间平均增加 8 倍,最高可达 41.6 倍。

关键词

引用

@article{arxiv.2501.11771,
  title  = {Characterization of GPU TEE Overheads in Distributed Data Parallel ML Training},
  author = {Jonghyun Lee and Yongqin Wang and Rachit Rajat and Murali Annavaram},
  journal= {arXiv preprint arXiv:2501.11771},
  year   = {2025}
}