IAA:内置架构赋予冻结大语言模型多模态能力
人工智能
2025-04-16 v2 计算与语言
机器学习
摘要
在多模态大语言模型(MLLM)领域,常见方法通常涉及在训练过程中解冻语言模型以促进深入的视觉理解。然而,针对视觉语言数据进行的微调常常会导致其自然语言处理(NLP)能力的下降。为避免这种性能下降,一种直接解决方案是在开发多模态能力时保持语言模型的冻结状态。然而,前期工作未能取得令人满意的效果。在冻结语言模型的策略基础上,我们进行了彻底的结构探索,提出了内置架构(IAA)。具体而言,该架构在大型语言模型内部嵌入多个多模态适配器,位于不同深度,以便直接与本质上以文本为导向的Transformer层进行交互,从而使冻结的语言模型能够获得多模态能力。与需要大规模对齐数据的先前冻结语言模型方法不同,我们提出的架构能够在小规模数据集上实现出色的性能。我们进行了大量实验,以提升模型的通用多模态能力和视觉 grounding 能力。我们的做法在 various vision-language benchmarks 上显著优于先前的 state-of-the-art 方法,同时不牺牲NLP任务的性能。代码和模型可在 https://github.com/360CVGroup/Inner-Adaptor-Architecture 获取。
引用
@article{arxiv.2408.12902,
title = {IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities},
author = {Bin Wang and Chunyu Xie and Dawei Leng and Yuhui Yin},
journal= {arXiv preprint arXiv:2408.12902},
year = {2025}
}
备注
AAAI 2025