中文

多模态指令调优后语言推理性能下降的训练-free 缓解方法

计算机视觉与模式识别 2024-12-05 v1 人工智能

摘要

多模态模型通常将强大的大语言模型(LLM)与视觉编码器结合,然后通过指令调优在多模态数据上进行训练。虽然这种过程使 LLM 适应多模态环境,但仍不清楚这种适应是否损害了其原始的语言推理能力。在本工作中,我们探讨了多模态指令调优对语言推理性能的影响。我们关注 LLaVA,这是一个领先的多模态框架,将 LLMs 如 Vicuna 或 Mistral 与 CLIP 视觉编码器集成。我们在八项语言推理任务上比较了原始 LLMs 与其多模态适应版的性能。我们的实验结果揭示了若干关键见解。首先,多模态学习的影响在 Vicuna 与 Mistral 之间存在差异:我们观察到在大多数任务上,Mistral 的语言推理性能下降,而 Vicuna 的性能提升。其次,尽管多模态指令学习在数学推理任务(如 GSM8K)上持续降低性能,但在常识推理任务(如 CommonsenseQA)上则提升了性能。最后,我们展示一种训练-free 模型融合技术可有效缓解多模态适应版 Mistral 中观察到的语言推理性能下降,甚至能提升视觉任务的性能。

关键词

引用

@article{arxiv.2412.03467,
  title  = {Training-Free Mitigation of Language Reasoning Degradation After Multimodal Instruction Tuning},
  author = {Neale Ratzlaff and Man Luo and Xin Su and Vasudev Lal and Phillip Howard},
  journal= {arXiv preprint arXiv:2412.03467},
  year   = {2024}
}