中文

VeOmni:面向任意模态模型训练的模型中心化分布配方动物园

计算与语言 2025-08-08 v3 人工智能 分布式、并行与集群计算

摘要

近年来,大型语言模型(LLM)的快速发展推动了多模态理解与生成方面的显著进展。然而,训练多模态LLM仍面临巨大挑战,由于需要处理多样化模态所需的异构模型架构, necessitating 精细的系统设计以实现高效大规模训练。现有框架通常将模型定义与并行逻辑绑定,导致可扩展性受限,以及端到端多模态训练的工程开发开销大。我们提出VeOmni,一个模块化且高效的训练框架,以加速多模态LLM的开发。VeOmni引入模型中心化分布配方,将通信与计算解耦,使多模态LLM能够实现高效的三维并行。VeOmni还提供灵活的配置界面,支持以最小代码改动实现新模态的无缝集成。借助VeOmni,可训练参数量达300亿的多模态混合专家(MoE)模型,在128个GPU上实现超过2800个token/秒/GPU的吞吐量,并通过三维并行扩展至16万长度的上下文,展示了其在大规模多模态LLM训练中的卓越效率与可扩展性。

关键词

引用

@article{arxiv.2508.02317,
  title  = {VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo},
  author = {Qianli Ma and Yaowei Zheng and Zhelun Shi and Zhongkai Zhao and Bin Jia and Ziyue Huang and Zhiqi Lin and Youjie Li and Jiacheng Yang and Yanghua Peng and Zhi Zhang and Xin Liu},
  journal= {arXiv preprint arXiv:2508.02317},
  year   = {2025}
}