图像无监督Transformer预训练:自蒸馏、均值教师与随机裁剪
计算机视觉与模式识别
2025-10-07 v1 机器学习
图像与视频处理
摘要
近期在自监督学习(SSL)方面的进展使得学习捕获图像高级语义与细粒度空间结构的通用视觉特征成为可能。最值得注意的是,DINOv2通过超越大多数基准测试上的弱监督方法(如OpenCLIP),树立了新的学习状态。在本综述中,我们检阅其方法背后的核心思想,包括多裁剪视图增强与自蒸馏结合均值教师,并追溯其在先前工作中的发展。随后我们比较DINO和DINOv2与其他SSL和WSL方法在各种下游任务上的性能,并强调其采用transformer backbone所学习特征的一些显著涌现属性。最后我们简要讨论DINOv2的局限性、其影响以及未来研究方向。
引用
@article{arxiv.2510.03606,
title = {Unsupervised Transformer Pre-Training for Images: Self-Distillation, Mean Teachers, and Random Crops},
author = {Mattia Scardecchia},
journal= {arXiv preprint arXiv:2510.03606},
year = {2025}
}