中文

多模态大语言模型中的跨模态信息流

人工智能 2025-03-28 v2 计算与语言 计算机视觉与模式识别

摘要

近期发展自回归多模态大语言模型 (MLLMs) 已在视觉语言任务中展现出有前景的进展。虽然已有多种研究探讨大语言模型中语言信息的处理机制,但关于 MLLMs 内部工作机制以及语言与视觉信息如何在这些模型中相互作用的了解仍有限。本研究旨在填补这一空白,通过考察 MLLMs 中不同模态(语言与视觉)之间的信息流,专注于视觉问答。具体而言,给定图像-问题对作为输入,我们探讨了视觉和语言信息在模型中何处以及如何被组合以生成最终预测。通过对 LLaVA 系列的一系列模型进行实验,我们发现两种不同的整合两种模态信息的阶段。在下层,模型首先将更通用的整幅图像视觉特征转化为 (语言) 问题 token 的表示。在中层,它再次将与问题相关的特定对象的视觉信息传递到问题的相应 token 位置。最后,在上层,结果多模态表示被传递到输入序列的最终位置以进行最终预测。总体而言,我们的发现为理解 MLLMs 中图像和语言处理的空间与功能方面提供了一种新型且全面的视角,从而促进了未来研究在多模态信息局部分析和编辑方面的发展。我们的代码和收集的数据集已发布: https://github.com/FightingFighting/cross-modal-information-flow-in-MLLM.git。

关键词

引用

@article{arxiv.2411.18620,
  title  = {Cross-modal Information Flow in Multimodal Large Language Models},
  author = {Zhi Zhang and Srishti Yadav and Fengze Han and Ekaterina Shutova},
  journal= {arXiv preprint arXiv:2411.18620},
  year   = {2025}
}