中文

探究自监督学习的中级视觉能力

计算机视觉与模式识别 2024-12-17 v2

摘要

中级视觉能力——如通用物体局部化和三维几何理解——不仅是人类视觉的基本能力,也是许多实际计算机视觉应用的关键。这些能力在人类视觉发展早期阶段便以最小的监督涌现。尽管如此,当前的自监督学习 (SSL) 方法主要为高层识别任务设计和评估,使其在中级视觉能力方面鲜有考察。本研究引入一套基准协议,系统评估中级视觉能力,并对 22 种突出 SSL 模型在 8 项中级视觉任务上的全面且受控评估。我们的实验揭示了中级和高层任务性能之间存在弱相关性。我们还识别出几种在中级和高层能力之间表现不平衡的 SSL 方法,以及一些在两者都表现卓越的方法。此外,我们研究了影响中级视觉性能的关键因素,例如预训练目标和网络架构。我们的研究提供了对 SSL 模型所学知识的全面而及时的视角,补充了主要关注高层视觉任务的现有研究。我们希望我们的发现指导未来的 SSL 研究在不仅仅是高层视觉任务上,对中级视觉任务进行基准测试。

关键词

引用

@article{arxiv.2411.17474,
  title  = {Probing the Mid-level Vision Capabilities of Self-Supervised Learning},
  author = {Xuweiyi Chen and Markus Marks and Zezhou Cheng},
  journal= {arXiv preprint arXiv:2411.17474},
  year   = {2024}
}

备注

Project Page: https://midvision-probe.cs.virginia.edu/