CoIN: 面向多模态大语言模型的持续指令微调基准
计算机视觉与模式识别
2024-10-24 v2
摘要
指令微调代表了多模态大语言模型(MLLMs)为对齐人类指令和适应新任务而采用的一种普遍策略。然而,MLLMs面临着适应用户不断演变的知识和需求的挑战。因此,需要研究如何在获取新知识的同时保留现有技能。在本文中,我们提出了一个全面的基准,即持续指令微调(CoIN),用于在序列指令微调范式下评估现有的MLLMs。CoIN包含10个常用数据集,涵盖8个任务类别,确保了指令和任务的多样性。此外,训练后的模型从两个方面进行评估:指令遵循和通用知识,分别评估与人类意图的对齐程度以及为推理而保留的知识。在CoIN上的实验表明,当前强大的MLLMs仍然遭受灾难性遗忘,并且意图对齐的失败是主要原因,而非知识遗忘。为此,我们将MoELoRA引入MLLMs,该方法能有效保留先前的指令对齐。实验结果一致表明,该方法在CoIN上减少了遗忘。
引用
@article{arxiv.2403.08350,
title = {CoIN: A Benchmark of Continual Instruction tuNing for Multimodel Large Language Model},
author = {Cheng Chen and Junchen Zhu and Xu Luo and Hengtao Shen and Lianli Gao and Jingkuan Song},
journal= {arXiv preprint arXiv:2403.08350},
year = {2024}
}