MoExtend:用于模态和任务扩展的专家调优框架
计算机视觉与模式识别
2024-08-08 v1 计算与语言
摘要
大型语言模型(LLM)在各类任务中表现优异,但主要基于文本数据训练,限制了其应用范围。将 LLM 的能力扩展至视觉-语言理解至为关键, yet 从头开始在多模态数据上训练则面临挑战且成本高昂。现有指令调优方法(如 LLAVA)通常通过全参数微调 LLM 来连接预训练的 CLIP 视觉编码器和 LLM 之间,以弥合模态鸿沟。然而,全参数微调存在灾难性遗忘问题,即忘却先前知识,同时训练成本高企,尤其在日益增多的任务和模态时更甚者。为解决此问题,我们引入 MoExtend—an 一个高效框架,用于简化 Mixture-of-Experts(MoE)模型的模态适应和扩展。MoExtend 可无缝集成新专家于预训练 MoE 模型中,赋予其新知识,而无需对预训练模型(如 MoE 和视觉编码器)进行调参。该方法实现了对新模态数据或任务的快速适应和扩展,有效解决了在 LLM 中容纳新模态的挑战。此外,MoExtend 避免对预训练模型的调参,从而缓解了灾难性遗忘的风险。实验结果表明,MoExtend 在提升 LLM 多模态能力方面具备有效性和效率,为多模态 AI 研究的发展作出了贡献。代码: https://github.com/zhongshsh/MoExtend。
引用
@article{arxiv.2408.03511,
title = {MoExtend: Tuning New Experts for Modality and Task Extension},
author = {Shanshan Zhong and Shanghua Gao and Zhongzhan Huang and Wushao Wen and Marinka Zitnik and Pan Zhou},
journal= {arXiv preprint arXiv:2408.03511},
year = {2024}
}
备注
ACL 2024 - SRW