中文

从下降到恢复:MLLMs 语义分割的机制分析

计算机视觉与模式识别 2026-03-19 v1 人工智能 机器学习

摘要

多模态大语言模型(MLLMs)正日益用于像素级视觉任务,但其对空间理解的内在能力仍鲜有了解。我们通过在整个 MLLM 管道上进行层次线性探针评估来调查分割能力:视觉编码器、适配器和 LLM。我们进一步基于注意力机制进行干预性 knockout 分析,以测试跨标记注意力是否逐步细化视觉表征,以及对图像标记之间双向注意力在空间一致性方面的评估。我们的分析揭示,适配器引入了分割表征的下降,但 LLM 层通过注意力中介的细化逐步恢复,其中被正确分类的标记引导误分类邻居趋向正确标签。在早期图像标记位置,这种恢复受到因果注意力的限制,而图像标记之间的双向注意力可缓解这一限制。这些发现为 MLLMs 处理分割任务的机制提供了说明,为未来面向分割设计的模型提供指导。

关键词

引用

@article{arxiv.2603.17228,
  title  = {From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs},
  author = {Boyong Wu and Sanghwan Kim and Zeynep Akata},
  journal= {arXiv preprint arXiv:2603.17228},
  year   = {2026}
}