中文

从像素到概念:分割模型理解其分割的内容吗?

计算机视觉与模式识别 2026-05-12 v1

摘要

分割是众多下游应用的基础视觉任务。近期的可提示分割模型(如 Segment Anything Model 3 (SAM3))将分割从类别无关的掩码预测扩展到以高级文本提示为条件的概念引导定位。然而,现有的基准测试主要评估掩码准确率或物体存在性,尚不清楚这些模型是忠实地定位了所查询的概念,还是依赖于视觉显著但语义上具有误导性的线索。我们引入了 CAFE:\textbf{C}ounterfactual \textbf{A}ttribute \textbf{F}actuality \textbf{E}valuation,一种用于评估可提示分割模型中概念忠实分割的新型基准测试。我们的 \textbf{CAFE} 基于属性级别的反事实操作构建:保留目标区域和真实掩码,同时修改表面外观、上下文或材料成分等属性以引入误导性语义线索。该基准包含 2,146 个配对测试样本,每个样本由目标图像、真实掩码、正向提示和误导性负向提示组成。这些样本涵盖三个反事实类别:表面模仿(\textbf{SM})、上下文冲突(\textbf{CC})和本体论冲突(\textbf{OC})。我们在 CAFE 上评估了各种模型类型和规模。实验揭示了定位质量与概念判别之间的系统性差距:模型经常为误导性提示生成准确的掩码,这表明强大的掩码预测并不一定意味着忠实的语义定位。我们的 CAFE 提供了一个受控的基准测试,用于诊断可提示分割模型是否执行概念忠实的定位,而非捷径驱动的掩码检索。

关键词

引用

@article{arxiv.2605.09591,
  title  = {From Pixels to Concepts: Do Segmentation Models Understand What They Segment?},
  author = {Shuang Liang and Zeqing Wang and Yuxian Li and Xihui Liu and Han Wang},
  journal= {arXiv preprint arXiv:2605.09591},
  year   = {2026}
}

备注

30 pages, 8 figures