Garfield:拜占庭机器学习的系统支持
机器学习
2021-01-01 v2
摘要
我们提出 Garfield,一个库,用于透明地使最初用流行(但脆弱)的框架(例如 TensorFlow 和 PyTorch)构建的机器学习(ML)应用具备拜占庭容错能力。Garfield 依赖一种新颖的面向对象设计,减少了编码工作量,并解决了经典 ML 框架所遵循的共享图架构的脆弱性。Garfield 包含多种通信模式并支持在 CPU 和 GPU 上计算,从而能够解决基于 SGD 的 ML 应用中拜占庭容错的实用成本这一普遍问题。我们报告了 Garfield 在三种主要 ML 架构上的使用:(a) 单服务器多工作节点,(b) 多服务器多工作节点,以及 (c) 点对点设置。利用 Garfield,我们强调了关于拜占庭容错成本的若干有趣事实。特别是,(a) 与崩溃容错不同,拜占庭容错会引起精度损失,(b) 吞吐量的开销更多来自通信而非鲁棒聚合,以及 (c) 容忍拜占庭服务器比容忍拜占庭工作节点代价更高。
引用
@article{arxiv.2010.05888,
title = {Garfield: System Support for Byzantine Machine Learning},
author = {Rachid Guerraoui and Arsany Guirguis and Jérémy Max Plassmann and Anton Alexandre Ragot and Sébastien Rouault},
journal= {arXiv preprint arXiv:2010.05888},
year = {2021}
}
备注
31 pages; 16 figures; 2 tables