中文

基于 LIMoE 的多模态对比学习:语言-图像混合专家模型

计算机视觉与模式识别 2022-06-07 v1

摘要

大型稀疏激活模型在多个领域取得了优异性能。然而,此类模型通常一次仅在单一模态上训练。我们提出语言-图像混合专家模型 LIMoE,一种能够进行多模态学习的稀疏混合专家模型。LIMoE 同时接收图像和文本,并使用对比损失进行训练。MoE 天然适合作为多模态骨干,因为专家层可以学习适当的模态划分。然而,新的挑战随之出现;特别是训练稳定性和专家利用的平衡性,我们为此提出了一种基于熵的正则化方案。在多个规模上,我们展示了相较同等计算成本的稠密模型显著的性能提升。LIMoE-L/16 以与 CLIP-L/14 相当的训练方式取得了 78.6% 的零样本 ImageNet 准确率(对比 76.2%),当进一步扩展到 H/14(使用额外数据)时达到 84.1%,与采用更大定制化逐模态骨干和预训练方案的最先进方法相当。我们分析了 LIMoE 的定量与定性行为,并展示了如模态的差异性处理以及模态特定专家的自然涌现等现象。

关键词

引用

@article{arxiv.2206.02770,
  title  = {Multimodal Contrastive Learning with LIMoE: the Language-Image Mixture of Experts},
  author = {Basil Mustafa and Carlos Riquelme and Joan Puigcerver and Rodolphe Jenatton and Neil Houlsby},
  journal= {arXiv preprint arXiv:2206.02770},
  year   = {2022}
}