Covenant-72B:基于信任等价节点在互联网上的72B参数大语言模型预训练
分布式、并行与集群计算
2026-03-11 v2 机器学习
摘要
近年来,全球分布式训练日益受到关注,既能降低训练成本,又能实现大规模基础模型建设的民主化参与。然而,现有模型在全球分布式方式下训练的规模相对较小,且仅限于获准参与者,尚未实现民主化参与的完整承诺。本报告描述了Covenant-72B,这是一个由最大规模全球分布式预训练运行(在计算和模型规模上)产生的LLM,同时支持开放、无许可参与,并由活跃区块链协议支持。我们采用最先进的通信高效优化器SparseLoCo,支持动态参与,允许节点自由加入和离开。该模型在约1.1万亿标记上进行预训练,性能与完全集中训练的模型相当,后者在类似或更高的计算预算下进行训练,表明在规模 unprecedented 的全球分布式预训练中,完全民主化、无许可的参与不仅是可行的,而且可以实现。
关键词
引用
@article{arxiv.2603.08163,
title = {Covenant-72B: Pre-Training a 72B LLM with Trustless Peers Over-the-Internet},
author = {Joel Lidin and Amir Sarfi and Erfan Miahi and Quentin Anthony and Shivam Chauhan and Evangelos Pappas and Benjamin Thérien and Eugene Belilovsky and Samuel Dare},
journal= {arXiv preprint arXiv:2603.08163},
year = {2026}
}
备注
26 pages, 6 figures, 4 tables; minor update, no content changes