中文

大型视觉语言模型的信息分解综合分析

计算与语言 2026-04-01 v1 人工智能 信息检索

摘要

大型视觉语言模型 (LVLMs) 取得了令人印象深刻的性能,但其内部决策过程仍不透明,难以确定成功是否源于真正的多模态融合还是依赖于单模态先验。为解决这一归因差距,我们引入了一种新框架,使用部分信息分解 (PID) 来定量测量 LVLMs 的“信息光谱”——将模型决策相关信息分解为冗余、唯一和协同三个组成部分。通过适应现代 LVLM 输出的可扩展估计器,我们的模型无关管道在四个数据集上对 26 个 LVLMs 进行分析,涵盖三个维度:广度(跨模型与跨任务)、深度(层级信息动力学)和时间(跨训练的学习动力学)。我们的分析揭示了两个关键结果:(i) 两种任务模式(协同驱动 vs. 知识驱动),以及 (ii) 两种稳定、相对立的家族级策略(融合导向 vs. 语言导向)。我们还发现层级处理中存在一致的三相模式,并识别出视觉指令调谐是学习融合的关键阶段。总体而言,这些贡献提供了一个超越仅准确率评估的定量镜头,为分析和设计下一代 LVLMs 提供了洞见。代码和数据均可用 https://github.com/RiiShin/pid-lvlm-analysis 提供。

关键词

引用

@article{arxiv.2603.29661,
  title  = {Agenda-based Narrative Extraction: Steering Pathfinding Algorithms with Large Language Models},
  author = {Brian Felipe Keith-Norambuena and Carolina Inés Rojas-Córdova and Claudio Juvenal Meneses-Villegas and Elizabeth Johanna Lam-Esquenazi and Angélica María Flores-Bustos and Ignacio Alejandro Molina-Villablanca and Joshua Emanuel Leyton-Vallejos},
  journal= {arXiv preprint arXiv:2603.29661},
  year   = {2026}
}

备注

Text2Story Workshop 2026 at ECIR 2026