Alchemist:面向高效在线持续学习系统的设计
机器学习
2025-03-17 v2 计算与语言
分布式、并行与集群计算
摘要
持续学习已成为通过利用用户反馈来逐步细化大型语言模型的有前景的解决方案。特别是在线持续学习——使用小批量用户反馈进行迭代训练——已显示出显著的性能提升。然而,现有的做法将训练和服务过程分离,迫使在线训练器在服务期间重新计算已经完成的中间结果。这种冗余计算可占总训练时间的 30%-42%。本文提出了 Alchemist,据我们所知,是首个高效复用服务激活值以提高训练吞吐量的在线持续学习系统。Alchemist 引入了两个关键技术:(1)仅在 prefill 阶段记录和存储激活值和 KV 缓存,以最小化延迟和内存开销;(2)智能激活卸载和 hedging。使用来自 ShareGPT 数据集抽取的不同 token 长度的输入进行评估,显示与独立的训练集群相比,Alchemist 将训练吞吐量提高最高可达 1.72 倍,训练期间内存使用降低最高可达 47%,支持最多 2 倍的训练 token——同时在保持服务延迟几乎不变的同时。
引用
@article{arxiv.2503.01066,
title = {Alchemist: Towards the Design of Efficient Online Continual Learning System},
author = {Yuyang Huang and Yuhan Liu and Haryadi S. Gunawi and Beibin Li and Changho Hwang},
journal= {arXiv preprint arXiv:2503.01066},
year = {2025}
}