中文

用于多模态模型微调的异构混合专家适配器

机器学习 2025-03-27 v1

摘要

多模态模型在跨模态任务中表现出色,但由于拥有数十亿参数,其计算成本高昂。参数高效微调 (PEFT) 通过添加小型可训练组件而冻结预训练参数,提供了解决方案。然而,现有方法主要关注单模态处理,忽略了多模态任务所必需的关键模态融合。为填补这一空白,我们提出了异构混合专家适配器,将传统 PEFT 框架扩展以支持多模态专家组合并提高信息互动。此外,我们的方法修改了仿射线性专家设计,以实现在低秩空间中的高效模态融合,仅需微调 5-8%的参数即可实现竞争性能。跨越八个下游任务(包括视觉-音频和文本-视觉)的实验表明,该方法的性能卓越。

关键词

引用

@article{arxiv.2503.20633,
  title  = {Enhancing Multi-modal Models with Heterogeneous MoE Adapters for Fine-tuning},
  author = {Sashuai Zhou and Hai Huang and Yan Xia},
  journal= {arXiv preprint arXiv:2503.20633},
  year   = {2025}
}

备注

6 pages,3 figures