中文

利用块坐标下降实现低成本大语言模型训练

机器学习 2025-09-29 v2 人工智能

摘要

训练大语言模型通常需要大量的 GPU 内存和大量的财务投资,这对许多中小型团队构成了障碍。在本文中,我们提出了一种基于块坐标下降(BCD)的全参数预训练和微调框架,并结合工程优化,使在成本效益高的 RTX 4090、A100 和 A800 GPU 集群上高效训练大规模模型成为可能。在相同硬件配置下,我们将 7B 模型的训练成本降低到 A100/A800 上的 33%,在 RTX 4090 上仅为 2.6%,相比标准全参数训练。它还使此前仅限于 A100 集群的大模型能够在 RTX 4090 上训练而不降低性能。BCD 在大多数情况下实现了与全参数和微调方法相当或更好的准确率,同时具有更低的 GPU 消耗和更高的硬件利用率。

关键词

引用

@article{arxiv.2506.12037,
  title  = {Exploiting Block Coordinate Descent for Cost-Effective LLM Model Training},
  author = {Zeyu Liu and Yan Li and Yunquan Zhang and Boyang Zhang and Guoyong Jiang and Xin Zhang and Limin Xiao and Weifeng Zhang and Daning Cheng},
  journal= {arXiv preprint arXiv:2506.12037},
  year   = {2025}
}

备注

We have revised certain details of the manuscript and incorporated new experimental