探究自监督学习的中级视觉能力
计算机视觉与模式识别
2024-12-17 v2
摘要
中级视觉能力——如通用物体局部化和三维几何理解——不仅是人类视觉的基本能力,也是许多实际计算机视觉应用的关键。这些能力在人类视觉发展早期阶段便以最小的监督涌现。尽管如此,当前的自监督学习 (SSL) 方法主要为高层识别任务设计和评估,使其在中级视觉能力方面鲜有考察。本研究引入一套基准协议,系统评估中级视觉能力,并对 22 种突出 SSL 模型在 8 项中级视觉任务上的全面且受控评估。我们的实验揭示了中级和高层任务性能之间存在弱相关性。我们还识别出几种在中级和高层能力之间表现不平衡的 SSL 方法,以及一些在两者都表现卓越的方法。此外,我们研究了影响中级视觉性能的关键因素,例如预训练目标和网络架构。我们的研究提供了对 SSL 模型所学知识的全面而及时的视角,补充了主要关注高层视觉任务的现有研究。我们希望我们的发现指导未来的 SSL 研究在不仅仅是高层视觉任务上,对中级视觉任务进行基准测试。
引用
@article{arxiv.2411.17474,
title = {Probing the Mid-level Vision Capabilities of Self-Supervised Learning},
author = {Xuweiyi Chen and Markus Marks and Zezhou Cheng},
journal= {arXiv preprint arXiv:2411.17474},
year = {2024}
}
备注
Project Page: https://midvision-probe.cs.virginia.edu/