SMAR:面向保持语言能力的基于软模态感知路由策略的多模态大语言模型
计算与语言
2025-06-26 v2 人工智能
摘要
混合专家 (MoE) 架构已成为扩大大语言模型规模的关键方法,越来越多地关注将其扩展到多模态任务。现有方法构建多模态 MoE 模型要么造成高训练成本,要么在适配预训练模型时导致语言能力下降。为此,我们提出 Soft Modality-Aware Routing (SMAR),一种新型正则化技术,通过 KL 散度控制跨模态的路由概率分布,鼓励专家专业化,而无需修改模型架构或大量依赖文本数据。实验在视觉指令调优方面表明,SMAR 以 86.6% 的语言能力保留率(仅使用 2.5% 纯文本)实现了超越基线的性能,同时保持强大的多模态性能。我们的做法为在多模态 MoE 模型中平衡模态差异和语言能力提供了实用且高效的解决方案。
引用
@article{arxiv.2506.06406,
title = {SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities},
author = {Guoyang Xia and Yifeng Ding and Fengfa Li and Lei Ren and Wei Chen and Fangxiang Feng and Xiaojie Wang},
journal= {arXiv preprint arXiv:2506.06406},
year = {2025}
}