中文

跟随流动:面向大语言模型的容错去中心化训练

机器学习 2025-09-26 v1 分布式、并行与集群计算

摘要

受大型语言模型(LLM)的兴起及其训练民主化重要性的驱动,我们提出GWTF,即首个实用去中心化LLM训练框架。不同于现有分布式和联邦训练框架,GWTF能够高效地在志愿资源的异构客户端上协作训练LLM。此外,GWTF解决节点 churn问题,即客户端随时可加入或离开系统;也解决网络不稳定问题,即网络链路变得不稳定或不可靠。GWTF的核心是一种新型去中心化流算法,寻找最有效的路由,以最小延迟最大化训练微批次的数量。我们在GPT类和LLaMa类模型上进行了广泛评估,并与现有技术进行了比较。我们的结果表明,在涉及分布在10个不同地理位置且节点 churn率较高的异构客户端节点的真实且具挑战性的场景下,GWTF可将训练时间缩短最高可达45%。

关键词

引用

@article{arxiv.2509.21221,
  title  = {Go With The Flow: Churn-Tolerant Decentralized Training of Large Language Models},
  author = {Nikolay Blagoev and Bart Cox and Jérémie Decouchant and Lydia Y. Chen},
  journal= {arXiv preprint arXiv:2509.21221},
  year   = {2025}
}