理解多模态大型语言模型中的信息存储与传输
计算机视觉与模式识别
2024-06-07 v1
摘要
理解基于Transformer模型中的信息存储和传输机制对于推动模型理解进展很重要。最近的工作研究了大型语言模型(LLMs)的这些机制,揭示了信息如何存储在模型参数中以及信息如何响应特定提示流向这些参数。然而,这些研究尚未扩展到多模态大型语言模型(MLLMs)。鉴于其不断扩展的能力和实际应用,我们首先研究这些模型的一个方面——MLLMs如何在事实性视觉问答任务中处理信息。我们使用基于约束的公式,将视觉问题视为具有一组视觉或文本约束,模型生成的答案必须满足这些约束才能正确(例如,这张照片中的导演执导的哪部电影获得了金球奖?)。在此设置下,我们贡献了:i) 一种将因果信息追踪从纯语言扩展到多模态设置的方法,以及ii) VQA-Constraints,一个包含9.7K个带约束注释的视觉问题的测试平台。我们使用这些工具研究两个开源MLLMs:LLaVa和多模态Phi-2。我们的关键发现表明,这些MLLMs依赖更早层的MLP和自注意力块进行信息存储,而LLMs的中层MLP更重要。我们还表明,视觉编码器输出的一小部分视觉令牌负责将信息从图像传输到这些因果块。我们通过引入MultEdit(一种模型编辑算法)验证了这些机制,该算法通过针对这些因果块,可以纠正错误并将新的长尾信息插入MLLMs。
引用
@article{arxiv.2406.04236,
title = {Understanding Information Storage and Transfer in Multi-modal Large Language Models},
author = {Samyadeep Basu and Martin Grayson and Cecily Morrison and Besmira Nushi and Soheil Feizi and Daniela Massiceti},
journal= {arXiv preprint arXiv:2406.04236},
year = {2024}
}
备注
20 pages