大型视觉-语言模型的综合信息分解分析
机器学习
2026-04-01 v1 计算与语言
计算机视觉与模式识别
摘要
大型视觉-语言模型(LVLM)取得了令人瞩目的性能,但其内部决策过程仍然不透明,这使得很难确定成功是源于真正的多模态融合还是依赖于单模态先验。为了解决这种归因差距,我们引入了一种使用部分信息分解(PID)的新框架,用于定量测量LVLM的“信息谱”——将模型的决策相关信息分解为冗余、独特和协同成分。通过将可扩展估计器适配到现代LVLM输出,我们的与模型无关的流程在三个维度上对4个数据集上的26个LVLM进行了分析——广度(跨模型和跨任务)、深度(逐层信息动态)和时间(跨训练的学习动态)。我们的分析揭示了两个关键结果:(i)两种任务机制(协同驱动与知识驱动)和(ii)两种稳定、对比鲜明的家族级策略(融合中心与语言中心)。我们还发现了逐层处理中一致的三阶段模式,并确定视觉指令微调是学习融合的关键阶段。总之,这些贡献提供了超越仅准确率评估的定量视角,并为分析和设计下一代LVLM提供了见解。代码和数据可在 https://github.com/RiiShin/pid-lvlm-analysis 获取。
引用
@article{arxiv.2603.29676,
title = {A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models},
author = {Lixin Xiu and Xufang Luo and Hideki Nakayama},
journal= {arXiv preprint arXiv:2603.29676},
year = {2026}
}
备注
Accepted at ICLR 2026. Project page: https://riishin.github.io/pid-lvlm-iclr26/