中文

统一多模态模型中的稀疏性:理解与利用

计算机视觉与模式识别 2025-12-03 v1 人工智能

摘要

大型多模态模型在理解与生成方面取得了显著进展。近期研究致力于构建统一的多模态模型,将异构组件集成到单一框架中以支持两种能力。然而,这种统一性会引入推理效率问题,例如特定任务或样本可能不需要完整的知识或模型容量。目前,针对不同组件中这些效率问题的系统性理解仍有限。本文首先通过训练-free 剪枝作为探针方法,对统一多模态模型组件进行系统性分析,考虑深度剪枝和宽度缩减。我们的研究表明,理解组件在理解与生成任务中均表现出显著的压缩性,而后者尤其在后者更为显著。相比之下,生成组件对压缩极其敏感,即使在适度的压缩比例下,性能也会急剧恶化。为此,我们提出一种基于混合专家 (MoE) 的适应方法,灵感来自不同样本中观察到的动态激活模式。该方法将生成模块划分为多个专家并通过稀疏激活以恢复生成质量。我们通过专家冻结调优验证了稀疏激活的有效性,并进一步表明完全可训练的适应方案可获得额外提升。结果表明,经过适配的 BAGEL 模型在性能上与完整模型相当,但仅激活约半数参数。代码已发布于 \href{https://github.com/Shwai-He/SparseUnifiedModel}{此链接}。

关键词

引用

@article{arxiv.2512.02351,
  title  = {Understanding and Harnessing Sparsity in Unified Multimodal Models},
  author = {Shwai He and Chaorui Deng and Ang Li and Shen Yan},
  journal= {arXiv preprint arXiv:2512.02351},
  year   = {2025}
}

备注

13 pages, 13 figures, 8 tables