MegaScale-Omni: 面向生产环境中多模态大语言模型训练的超大规模、负载自适应系统
分布式、并行与集群计算
2026-05-12 v1
摘要
作为通用人工智能应用的基础组件,训练多模态大语言模型(MLLM)依赖于具有动态模态混合比例和样本长度分布的多模态数据集。然而,由于编码器和LLM主干网络之间的资源分配和模型并行化决策是静态耦合的,现有MLLM系统在动态工作负载下效率低下。本文介绍了 MegaScale-Omni,一个为适应动态工作负载和超大规模部署而量身定制的工业级 MLLM 训练系统。MegaScale-Omni 建立在编码器-LLM 多路复用训练方案之上,具有三项关键创新:(1) 解耦的并行化策略,为编码器采用长短序列并行性以处理可变长度样本,为LLM主干网络采用全面的5D并行性,两者均组织在通信高效的并行化布局下。(2) 统一的编码器-LLM表示,用于灵活、可扩展的共置,以及一种具有工作负载弹性的编码器-LLM联合流水线新范式。(3) 通过数据加载器中的去中心化分组重排序和从编码器到LLM ranks的自适应重分片实现的工作负载均衡技术。MegaScale-Omni 作为我们内部大规模 MLLM 训练任务的基础进行部署,使用了数千个 GPU。我们的实验结果表明,与四种最先进的系统相比,在生产级动态工作负载下,吞吐量提升了 1.27 倍至 7.57 倍。
引用
@article{arxiv.2605.08962,
title = {MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production},
author = {Chunyu Xue and Yangrui Chen and Jianyu Jiang and Ningxin Zheng and Junda Feng and Jingji Chen and Shixiong Zhao and Shen Yan and Yi Lin and Lei Shi and Zanbo Wang and Lishu Luo and Faming Wu and Haibin Lin and Xin Liu and Yanghua Peng and Quan Chen},
journal= {arXiv preprint arXiv:2605.08962},
year = {2026}
}