中文

PixFoundation:我们正朝着像素级视觉基础模型的正确方向前进吗?

计算机视觉与模式识别 2026-01-27 v4

摘要

已有多种工作涌现,旨在推动多模态大语言模型(MLLMs)向像素级理解发展。当前的趋势是,在大规模标注数据上使用掩码形式的像素级定位监督,并采用专门的分割任务解码器来训练MLLMs。然而,我们发现,当在近期具有挑战性的以视觉为中心的基准上进行评估时,这类MLLMs在视觉问答(VQA)方面表现出较弱的能力。令人惊讶的是,其中一些方法甚至降低了那些从未经过此类像素级监督训练的MLLMs的定位能力。在这项工作中,我们提出了两个新颖且具有挑战性的基准,并配以对VQA和定位的成对评估。我们证明,非统一的简单基线模型,其性能能够匹敌甚至超越某些像素级MLLMs。我们的配对基准和评估使得能够对VQA和/或定位方面的失败原因进行额外分析。此外,我们针对定位任务,对语言和视觉提示进行了提示敏感性分析。更重要的是,我们研究了这样一个研究问题:“MLLMs中的定位能力是何时相对于输出令牌出现的?”我们提出了一种可解释性工具,可以插入任何MLLM中来研究上述问题。我们表明,定位不一定与输出中的确切指代表达式重合,但可能与物体的部分、位置、外观、上下文或状态重合。代码和数据集已在 https://msiam.github.io/PixFoundationSeries/ 上公开。

关键词

引用

@article{arxiv.2502.04192,
  title  = {PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?},
  author = {Mennatullah Siam},
  journal= {arXiv preprint arXiv:2502.04192},
  year   = {2026}
}

备注

Under Review