中文

通过参数合并与解耦实现大语言模型的多模态扩展与保留

计算与语言 2025-05-26 v1

摘要

通过在新模态数据上从零进行微调,大型语言模型(LLM)可以扩展其可处理的模态种类,从而形成多模态大语言模型(MLLM)。然而,这一范式高度依赖资源密集且灵活性差的从零微调。本文提出了MMER(Multi-modality Expansion and Retention),一种无需训练即可集成现有MLLM以实现有效多模态扩展并保留原始性能的训练-free方法。具体而言,MMER复用MLLM的多模态编码器,同时合并其LLM参数。通过比较原始与合并后的LLM参数,MMER生成二进制掩码,以大致分离每个模态的LLM参数。这些解耦参数可独立处理模态特定输入,减少参数冲突并保留原始MLLM的忠实度。MMER还可通过对MLLM在新任务上微调后类似地应用此过程来缓解灾难性遗忘。大量实验表明,MMER在基线方法上实现显著提升,证明其有效地扩展了LLM的多模态能力,同时保留了99%的原始性能,并且显著缓解了灾难性遗忘。

关键词

引用

@article{arxiv.2505.17110,
  title  = {Multi-Modality Expansion and Retention for LLMs through Parameter Merging and Decoupling},
  author = {Junlin Li and Guodong DU and Jing Li and Sim Kuan Goh and Wenya Wang and Yequan Wang and Fangming Liu and Ho-Kin Tang and Saleh Alharbi and Daojing He and Min Zhang},
  journal= {arXiv preprint arXiv:2505.17110},
  year   = {2025}
}