中文

无监督语义分割促进模型理解

计算机视觉与模式识别 2026-05-29 v1

摘要

自监督学习(self-supervised learning, SSL)已经产生了多样化的视觉变换器(vision transformers, ViTs),其预训练表示支持广泛的下游任务。为了更好地理解这些模型,已有工作评估了其自注意力机制以及其表示中捕获的信息类型,揭示了例如使用对比学习(contrastive learning, CL)与掩码图像建模(masked image modeling, MIM)训练的模型之间存在的显著差异。然而,这些在模型理解方面的进展尚未完全渗透到更广泛的社区,其中一些针对 CL 模型的洞见有时被推广到 MIM 模型。为便于广大受众轻松直观地理解模型,本文提出一种简单且易解释的可视化协议。该协议基于可视化无监督语义分割结果,然而我们的目标并非最大化分割性能。相反,它允许我们传达跨图像一致出现的模型行为。对多样化的 SSL 模型进行分层和表示基准测试,我们获得了关于不同位置偏差和规模行为的新见解,包括 DINOv3-Large 模型标记中强烈的边界伪影。这些见解补充并帮助传达一系列先前发现。我们的协议进一步 enables 清晰地区分位置效应与 closely related 但 distinct 的 locality 偏差,后者在文献中研究得更为广泛。该协议已公开于 GitHub, 我们相信它将催化更广泛的社区对模型的进一步理解。

关键词

引用

@article{arxiv.2605.29691,
  title  = {Unsupervised Semantic Segmentation Facilitates Model Understanding},
  author = {Xiaoyan Yu and Lisa Mais and Jannik Franzen and Peter Hirsch and Nick Lechtenbörger and Andreas Mardt and Dagmar Kainmüller},
  journal= {arXiv preprint arXiv:2605.29691},
  year   = {2026}
}