MinT:用于训练和服务数百万个大语言模型的托管基础设施
摘要
我们提出了 MindLab Toolkit (MinT),一个用于 Low-Rank Adaptation (LoRA) 后训练和在线服务的托管基础设施系统。MinT 针对的场景是:在少量昂贵的基础模型部署上生成大量已训练的策略。与此不同,MinT 不将每个策略作为合并后的完整检查点来实例化,而是保持基础模型常驻,并将导出的 LoRA adapter 修订版本依次经过 rollout、update、export、evaluation、serving 与 rollback,隐藏了分布式训练、服务、调度和数据移动的复杂性。MinT 沿着三个维度扩展了这一路径。Scale Up 扩展了 LoRA 强化学习到前沿级稠密和 MoE 架构,包括 MLA 和 DSA 注意力路径,训练和服务参数超过 1T。Scale Down 只移动导出的 LoRA adapter,后者在 rank-1 设置下可小于基础模型大小的 1%;adapter-only 的交接将 4B 稠密模型的测量步骤降低 18.3 倍,将 30B MoE 降低 2.85 倍,同时在不提升峰值内存的前提下,并发多策略 GRPO 将墙面时间缩短 1.77 倍和 1.45 倍。Scale Out 将可靠的策略可寻址性与 CPU/GPU 工作集分离:张量并行部署支持 10^6 规模的可寻址目录(测量单引擎遍历 100K),并在集群规模下实现千级 adapter 的活跃波动,冷加载被视为计划服务工作,压缩后的 MoE LoRA 张量在实际引擎加载方面提升 8.5-8.7 倍。因此,MinT 能够在训练和服务选定的 adapter 修订版本的同时,管理数百万规模的 LoRA 策略目录,所有这些都运行在共享的 1T 级基础模型之上。
引用
@article{arxiv.2605.13779,
title = {MinT: Managed Infrastructure for Training and Serving Millions of LLMs},
author = {Mind Lab and : and Song Cao and Vic Cao and Andrew Chen and Kaijie Chen and Cleon Cheng and Steven Chiang and Kaixuan Fan and Hera Feng and Huan Feng and Arthur Fu and Jun Gao and Hongquan Gu and Aaron Guan and Nolan Ho and Mutian Hong and Hailee Hou and Peixuan Hua and Charles Huang and Miles Jiang and Nora Jiang and Yuyi Jiang and Qiuyu Jin and Fancy Kong and Andrew Lei and Kyrie Lei and Alexy Li and Lucian Li and Ray Li and Theo Li and Zhihui Li and Jiayi Lin and Kairus Liu and Kieran Liu and Logan Liu and Xiang Liu and Irvine Lu and Maeve Luo and Runze Lv and Pony Ma and Verity Niu and Anson Qiu and Vincent Wang and Rio Yang and Maxwell Yao and Carrie Ye and Regis Ye and Wenlin Ye and Josh Ying and Danney Zeng and Yuhan Zhan and Anya Zhang and Di Zhang and Ruijia Zhang and Sueky Zhang and Ya Zhang and Wei Zhao and Ada Zhou and Changhai Zhou and Yuhua Zhou and Xinyue Zhu and Murphy Zhuang},
journal= {arXiv preprint arXiv:2605.13779},
year = {2026}
}
备注
30 pages, technical report