GPT Carry-On:训练基础模型进行定制化可以简单、可扩展且经济实惠
机器学习
2025-04-11 v1 人工智能
分布式、并行与集群计算
机器学习
摘要
现代大型语言基础模型(LLM)现已进入数百万用户的日常生活。我们提出一个自然的问题:是否可以为每个用户或每个任务定制LLM?从系统和工业经济角度考虑,一般的继续训练或微调仍然需要大量训练GPU节点的计算和内存,而大多数部署中的推理节点(可能配备较低端的GPU)被配置为尽可能快地执行前向传播。我们提出了一个框架,充分利用现有LLM和在线服务系统。我们在预训练LLM的最终层嵌入上训练一个额外的Transformer块分支作为基础,然后一个附加模块合并基础模型以组成定制的LLM。我们可以混合多个层,或混合多个在不同领域(如聊天、编码、数学)专长的LLM,形成最适合新任务的LLM新混合体。由于基础模型不需要更新参数,我们能够将训练作业的大部分计算外包给推理节点,仅在训练节点上训练轻量级的附加模块,其中我们消耗不到1GB的GPU内存来在30B LLM上训练100M的附加层。我们测试了Qwen和DeepSeek开源模型进行继续预训练,并获得了更快的损失收敛。我们用它来以极小的计算量和模型大小改进数学问题求解,使用1000个思维链数据样本,以及小至1MB参数的两层附加层,结果令人鼓舞。
引用
@article{arxiv.2504.07513,
title = {GPT Carry-On: Training Foundation Model for Customization Could Be Simple, Scalable and Affordable},
author = {Jianqiao Wangni},
journal= {arXiv preprint arXiv:2504.07513},
year = {2025}
}