中文

PILL:基于适配器专家与注意力门的即插式大语言模型架构

计算机视觉与模式识别 2023-11-07 v1

摘要

由于强大的大语言模型(LLMs)在有效遵循指令方面的卓越能力,社区中出现了越来越多辅助人类的助手。近来,视觉语言模型(VLMs)的发展取得了显著进展,扩展了LLMs的能力并使其能执行更多样化的指令。然而,可以预见模型很可能需要处理涉及语音、视频等其他模态的任务。这带来了处理混合模态复杂性的突出挑战。为此,我们引入了一种称为PILL的新颖架构:基于适配器专家与注意力门的即插式大语言模型(Plug Into LLM with adapter expert and attention gate),以更好地解耦这些复杂模态并利用高效微调。我们引入两个模块:首先,利用混合模态适配器专家(Mixture-of-Modality-Adapter-Expert)独立处理不同模态,在保留原始模型表达能力的同时更好地适应下游任务;其次,通过引入模态注意力门控(Modality-Attention-Gating),自适应控制模态令牌对整体表示的贡献。此外,我们改进了适配器以增强其学习与表达能力。实验结果表明,我们的方法在模态融合方面相较于其他主流方法具有竞争力。对本文工作感兴趣的研究者,可在 https://github.com/DsaltYfish/PILL 免费获取代码与模型。

关键词

引用

@article{arxiv.2311.02126,
  title  = {PILL: Plug Into LLM with Adapter Expert and Attention Gate},
  author = {Fangyuan Zhang and Tingting Liang and Zhengyuan Wu and Yuyu Yin},
  journal= {arXiv preprint arXiv:2311.02126},
  year   = {2023}
}