中文

用稀疏专家混合扩展视觉-语言模型

计算机视觉与模式识别 2023-03-14 v1 计算与语言

摘要

自然语言处理(NLP)领域近年来取得显著进展,尤其在大规模视觉-语言模型(VLMs)的发展方面。这些模型旨在弥合文本与视觉信息之间的鸿沟,实现对多媒体数据更全面的理解。然而,随着这些模型变得更大且更复杂,其训练和部署也变得更具挑战性。应对该挑战的一种方法是使用稀疏门控专家混合(MoE)技术,该技术将模型划分为可联合解决任务的更小、专门化的子模型。本文中,我们探索了MoE在扩展视觉-语言模型中的有效性,展示了其在一系列基准上相对于同等计算成本的稠密模型取得最先进性能的潜力。我们的研究为稳定MoE模型训练、理解MoE对模型可解释性的影响,以及权衡扩展VLM时计算性能之间的折中提供了宝贵见解。我们希望我们的工作能启发进一步研究将MoE用于扩展大规模视觉-语言模型及其他多模态机器学习应用。

关键词

引用

@article{arxiv.2303.07226,
  title  = {Scaling Vision-Language Models with Sparse Mixture of Experts},
  author = {Sheng Shen and Zhewei Yao and Chunyuan Li and Trevor Darrell and Kurt Keutzer and Yuxiong He},
  journal= {arXiv preprint arXiv:2303.07226},
  year   = {2023}
}

备注

Preprint