节点早于边:探究大型视觉语言模型中图表示的探针
计算与语言
2026-03-04 v1 计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)在图理解基准测试中表现出强大的性能,但仍在理解元素之间的关系方面存在挑战,尤其是由节点和有向边(例如箭头和线)表示的关系。在为此限制因素寻找出根本原因方面,我们使用基于有向图的合成图数据集探针LVLMs的内部表示。我们的探针实验揭示,边信息在视觉编码器中并非线性可分离,仅在语言模型中的文本标记中才呈现线性编码。相比之下,节点信息和全局结构特征已在视觉编码器的单个隐藏状态中线性编码。这些发现表明,线性可分表示形成的阶段取决于所需的视觉信息类型。特别是,边表示延迟出现的可能有助于解释LVLMs为何在需要更抽象、组合集成过程的关系理解(例如解释边的方向)方面存在困难。
引用
@article{arxiv.2603.02865,
title = {Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models},
author = {Haruto Yoshida and Keito Kudo and Yoichi Aoki and Ryota Tanaka and Itsumi Saito and Keisuke Sakaguchi and Kentaro Inui},
journal= {arXiv preprint arXiv:2603.02865},
year = {2026}
}