中文

探究多模态大语言模型中的灾难性遗忘

计算与语言 2023-12-06 v4 人工智能 机器学习

摘要

继 GPT4 取得成功之后,多模态大语言模型(MLLM)研究兴趣激增。该研究方向聚焦于通过微调预训练 LLM 与视觉模型来开发通用 LLM。然而,灾难性遗忘——即微调模型无法保持相较预训练模型相似性能的臭名昭著现象——仍是多模态 LLM(MLLM)中的固有问题。本文中,我们引入 EMT:评估多模态(Evaluating MulTimodality)以评估 MLLM 中的灾难性遗忘,将每个 MLLM 视为图像分类器。我们首先应用 EMT 评估若干开源微调 MLLM,发现几乎所有被评估 MLLM 在标准图像分类任务上均未能保持与其视觉编码器同等的性能水平。此外,我们继续微调 MLLM LLaVA,并利用 EMT 评估微调过程中的性能。有趣的是,我们的结果表明,在图像数据集上的早期微调通过增强文本与视觉特征的对齐而提升跨其他图像数据集的性能。然而,随着微调推进,MLLM 开始幻觉,导致泛化性显著丧失,即便图像编码器保持冻结。我们的结果表明,MLLM 在标准图像分类任务上尚待展现出与其视觉模型相当的性能,且当前 MLLM 微调流程仍有改进空间。

关键词

引用

@article{arxiv.2309.10313,
  title  = {Investigating the Catastrophic Forgetting in Multimodal Large Language Models},
  author = {Yuexiang Zhai and Shengbang Tong and Xiao Li and Mu Cai and Qing Qu and Yong Jae Lee and Yi Ma},
  journal= {arXiv preprint arXiv:2309.10313},
  year   = {2023}
}