中文

在自监督表征学习中摆脱大数据范式

计算机视觉与模式识别 2026-03-09 v2

摘要

对大规模数据集和广泛计算资源的依赖已成为视觉表征学习中的主要障碍,尤其是在数据稀缺领域。在本文中,我们针对这个关键问题提出:我们能否在从图像中进行自监督表征学习时摆脱大数据范式?我们引入 SCOTT(稀疏卷积标记化器 for Transformers),这是一种与掩码图像建模 (MIM) 任务兼容的浅层标记化架构。SCOTT 将卷积归纳偏置注入到视觉转换器 (ViTs) 中,增强了其在小规模数据 regime 中的有效性。同时,我们提出在 MIM 框架内采用联合嵌入预测架构 (MIM-JEPA) 训练, operates in latent representation space 以捕获更丰富的语义特征。我们的做法使 ViTs 能够在通常需要的规模的数百倍于传统方法的数据集上从头训练——无需依赖大规模外部数据集进行预训练。在三个小规模、标准分辨率、细粒度数据集上进行验证:Oxford Flowers-102、Oxford IIIT Pets-37 和 ImageNet-100。尽管面临数据有限和类别内相似性大的挑战,冻结的 SCOTT 模型经 MIM-JEPA 预训练后显著优于完全监督的方法,并与依赖大规模预训练、复杂图像增广和更大模型大小的 SOTA 方法取得了竞争成绩。通过表明在有限数据、计算资源和模型规模的情况下可以学习到鲁棒的即插即用表征,我们的工作为医学成像或机器人等资源受限环境中的计算机应用开辟了道路。我们的发现挑战了数据极大是有效表征学习在视觉领域不可或缺假设,为该领域更具可及性和包容性的进步提供了新路径。

关键词

引用

@article{arxiv.2502.18056,
  title  = {Escaping The Big Data Paradigm in Self-Supervised Representation Learning},
  author = {Carlos Vélez García and Miguel Cazorla and Jorge Pomares},
  journal= {arXiv preprint arXiv:2502.18056},
  year   = {2026}
}

备注

Code and implementation available at: https://github.com/inescopresearch/scott