用混合专家应对多模态学习挑战:综述
机器学习
2026-05-28 v1 人工智能
摘要
混合专家(MoE)为多模态学习提供了一个天然兼容且可扩展的框架,展示了跨不同模态和任务的强大适应性。尽管其日益成功,但关于解决多模态挑战的MoE方法的全面且系统的综述仍然缺乏。现有的综述倾向于从方法分类学的角度独立评估多模态学习或MoE,忽略了两者之间独特的相互作用。本综述通过回答一个核心问题来填补这一空白:\n\textit{MoE如何有效解决多模态挑战?}\n我们从三个关键视角来探讨这个问题:(1) \textbf{MoE作为高效多模态引擎:}通过将计算成本与参数增长解耦,并通过选择性专家激活减轻模态冗余,实现可扩展的多模态建模;(2) \textbf{MoE作为多模态表示学习器:}整合互补的多观点专家知识以丰富对齐和交互表示;(3) \textbf{MoE作为多模态适配器:}提供一种模块化和灵活的机制来建模不完美的数据场景,例如模态不平衡和模态缺失。通过我们广泛的文献回顾,我们识别出关键的研究空白,包括可解释路由、专家通信、模态集成和终身多模态学习。我们将本综述定位为未来研究可解释和可持续的多模态混合专家系统的基础。
引用
@article{arxiv.2605.27431,
title = {Tackling Multimodal Learning Challenges with Mixture-of-Expert: A Survey},
author = {Liangwei Nathan Zheng and Wei Emma Zhang and Olaf Maennel and Lin Yue and Weitong Chen},
journal= {arXiv preprint arXiv:2605.27431},
year = {2026}
}
备注
This survey paper has just been accepted by IJCAI 2026. Results were released by 30 April 2026. As I could not find a particular place to drop the acceptance email. I have upload the acceptance email alongside the LaTeX files of the paper, named as Acceptance_email.pdf