如何将视觉转化为语言:多模态推理的信息论分层分析
人工智能
2026-02-18 v1
摘要
当多模态Transformer回答视觉问题时,预测是由视觉证据、语言推理还是真正的跨模态计算驱动的——以及这种结构如何随层数演变?我们提出基于部分信息分解(PID)的分层框架,对每个Transformer层的预测信息进行分解,分为冗余、视觉唯一、语言唯一和 synergistic 四个组成部分。为使PID在高维神经表征中可实现,我们引入\emph{PID Flow}管道,结合降维、正规化流高斯化和闭形式高斯PID估计。将该框架应用于LLaVA-1.5-7B和LLaVA-1.6-7B,覆盖六个GQA推理任务,我们发现一致的\emph{模态转化}模式:视觉唯一信息在早期峰值并随深度衰减,语言唯一信息在后期层数显著上升,最终占预测约82%,而跨模态协同效应始终低于2%。这种轨迹在模型变体(层级相关性>0.96)中高度稳定,但对具体任务高度依赖,语义冗余主导详细信息指纹的形成。为建立因果关系,我们执行针对性的ImageQuestion注意力消除实验,结果表明:扰乱主要转化通路会导致被困视觉唯一信息增加、补偿性协同效应以及总信息成本上升——这些效应在依赖视觉的任务中最为显著,在高冗余任务中最为微弱。综上,这些结果提供了关于多模态Transformer中视觉如何转化为语言的信息论因果解释,为识别模态特定信息丢失的架构瓶颈提供了定量指导。
引用
@article{arxiv.2602.15580,
title = {How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning},
author = {Hongxuan Wu and Yukun Zhang and Xueqing Zhou},
journal= {arXiv preprint arXiv:2602.15580},
year = {2026}
}