Wings:学习无文本遗忘的多模态大语言模型
计算与语言
2024-06-06 v1 人工智能
机器学习
摘要
多模态大语言模型(MLLM)以预训练的LLM为起点,首先将图像与文本对齐,然后在多模态混合输入上进行微调。然而,MLLM会灾难性地遗忘不包含图像的纯文本指令,而这些指令可以在初始LLM中处理。在本文中,我们提出了Wings,一种在纯文本对话和多模态理解方面都表现出色的新型MLLM。分析MLLM在 multimodal 指令中的注意力揭示了文本遗忘与从图像前文本到图像后文本的注意力转移有关。由此,我们构建了额外的模块作为增强学习器来补偿注意力转移。互补的视觉和文本学习器,如同两侧的“翅膀”,在每个层的注意力块内并行连接。最初,图像和文本输入与视觉学习器一起对齐,视觉学习器与主注意力并行运行,平衡对视觉元素的关注。随后,文本学习器通过基于注意力的路由进行协作集成,以融合视觉和文本学习器的输出。我们设计了低秩残差注意力(LoRRA)来保证学习器的高效率。我们的实验结果表明,在纯文本和视觉问答任务中,Wings均优于同等规模的MLLM。在新构建的交错图像-文本(IIT)基准测试中,Wings在从纯文本丰富到多模态丰富的问答任务中表现出卓越的性能。
引用
@article{arxiv.2406.03496,
title = {Wings: Learning Multimodal LLMs without Text-only Forgetting},
author = {Yi-Kai Zhang and Shiyin Lu and Yang Li and Yanqing Ma and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang and De-Chuan Zhan and Han-Jia Ye},
journal= {arXiv preprint arXiv:2406.03496},
year = {2024}
}