中文

视觉大语言模型推理的相图:来自图像与指令交互的视角

计算与语言 2025-05-16 v2

摘要

视觉大语言模型(VLLMs)通常将输入作为图像令牌嵌入与文本令牌嵌入的拼接,并执行因果建模。然而,其内部行为仍未被充分探索,引发了对两种类型令牌之间交互的疑问。为研究推理过程中的这种多模态交互,本文测量了来自不同模态的令牌隐藏状态向量之间的上下文化。实验揭示了VLLM在基于Transformer的语言模型深度上的四阶段推理动力学,包括:(I) 对齐:在非常早期的层中,模态之间出现上下文化,表明特征空间对齐。(II) 模态内编码:在早期层中,模态内上下文化增强而模态间交互被抑制,表明模态内的局部编码。(III) 模态间编码:在后期层中,跨模态上下文化增强,表明更深层的跨模态融合。(IV) 输出准备:在非常晚期的层中,上下文化全局减少,隐藏状态向解嵌入空间对齐。

关键词

引用

@article{arxiv.2411.00646,
  title  = {Phase Diagram of Vision Large Language Models Inference: A Perspective from Interaction across Image and Instruction},
  author = {Houjing Wei and Yuting Shi and Naoya Inoue},
  journal= {arXiv preprint arXiv:2411.00646},
  year   = {2025}
}

备注

6 pages, 5 figures