中文

激励无许可的 LLM 分布式学习

机器学习 2025-05-29 v1 分布式、并行与集群计算

摘要

我们描述了一个用于基础模型分布式深度学习的激励系统,其中节点因其贡献而获得奖励。该激励系统 \textit{Gauntlet} 已部署在 bittensor 区块链上,并用于在完全无许可的伪梯度贡献下训练一个 1.2B LLM:对可注册的用户或其硬件没有任何控制。\textit{Gauntlet} 可应用于任何依赖聚合更新或伪梯度的同步分布式训练方案。我们依赖两阶段机制来快速筛选节点的正常运行时间、可靠性和同步性,并结合核心组件来估计单个伪梯度贡献前后的损失。我们利用 OpenSkill 评级系统来跟踪伪梯度得分随时间的竞争力。最后,我们引入了一种新颖的机制,以确保网络上的节点执行唯一的计算。我们的实时 1.2B 运行根据参与者贡献的价值向其支付了真实代币,产生了一个具有竞争力的(在每次迭代的基础上)1.2B 模型,证明了我们激励系统的效用。

关键词

引用

@article{arxiv.2505.21684,
  title  = {Incentivizing Permissionless Distributed Learning of LLMs},
  author = {Joel Lidin and Amir Sarfi and Evangelos Pappas and Samuel Dare and Eugene Belilovsky and Jacob Steeves},
  journal= {arXiv preprint arXiv:2505.21684},
  year   = {2025}
}