中文

MoMa:基于模态感知专家混合的高效早期融合预训练

人工智能 2024-08-13 v3 机器学习

摘要

我们介绍 MoMa,这是一种新颖的模态感知混合专家(MoE)架构,用于预训练混合模态、早期融合语言模型。MoMa 通过将专家模块分为模态特定组来处理图像和文本,以任意顺序。这些组专为处理特定 token,同时在每个组内部采用学习路由以保持语义感知的适应性。我们的实验结果揭示,通过这种模态特定参数分配,实现了显著的预训练效率提升。在1万亿 token 的训练预算下,MoMa 1.4B 模型(包含4个文本专家和4个图像专家)实现了显著的 FLOPs 节省:总体节省3.7倍,其中文本处理节省2.6倍,图像处理节省5.2倍,与计算等效的稠密基线相比。与标准专家选择 MoE(包含8个混合模态专家)相比,后者实现了3倍的总体 FLOPs 节省(文本3倍,图像2.8倍)。将 MoMa 与混合深度(MoD)结合进一步提高了预训练 FLOPs 节省至4.2倍总体(文本3.4倍,图像5.3倍),尽管这种组合因路由器准确性更敏感而损害了因果推断性能。这些结果表明 MoMa 有望显著推动混合模态、早期融合语言模型预训练的效率,为更高效且更具能力的多模态 AI 系统铺平了道路。

关键词

引用

@article{arxiv.2407.21770,
  title  = {MoMa: Efficient Early-Fusion Pre-training with Mixture of Modality-Aware Experts},
  author = {Xi Victoria Lin and Akshat Shrivastava and Liang Luo and Srinivasan Iyer and Mike Lewis and Gargi Ghosh and Luke Zettlemoyer and Armen Aghajanyan},
  journal= {arXiv preprint arXiv:2407.21770},
  year   = {2024}
}

备注

v2 -> update related work section v3 -> fix spelling