DINOv2:在无监督条件下学习鲁棒视觉特征
计算机视觉与模式识别
2024-02-05 v2
摘要
近期自然语言处理在大规模数据模型预训练上的突破,为计算机视觉中类似的基石模型开辟了道路。这些模型可通过生成通用视觉特征(即无需微调即可跨图像分布与任务工作的特征)来极大简化任何系统中图像的使用。本工作表明,现有的预训练方法,尤其是自监督方法,若在来自多样来源的足够精选数据上训练,便能产生此类特征。我们重访已有方法并组合不同技术,以在数据与模型规模上扩展预训练。大部分技术贡献旨在加速并稳定大规模训练。在数据方面,我们提出一条自动流水线来构建专用、多样且经过筛选的图像数据集,而非像自监督文献中通常所做的那样使用未筛选数据。在模型方面,我们训练了一个含 10 亿参数的 ViT 模型(Dosovitskiy 等,2020),并将其蒸馏为一系列更小的模型,这些模型在图像与像素层级的大多数基准上超越了现有最佳通用特征 OpenCLIP(Ilharco 等,2021)。
引用
@article{arxiv.2304.07193,
title = {DINOv2: Learning Robust Visual Features without Supervision},
author = {Maxime Oquab and Timothée Darcet and Théo Moutakanni and Huy Vo and Marc Szafraniec and Vasil Khalidov and Pierre Fernandez and Daniel Haziza and Francisco Massa and Alaaeldin El-Nouby and Mahmoud Assran and Nicolas Ballas and Wojciech Galuba and Russell Howes and Po-Yao Huang and Shang-Wen Li and Ishan Misra and Michael Rabbat and Vasu Sharma and Gabriel Synnaeve and Hu Xu and Hervé Jegou and Julien Mairal and Patrick Labatut and Armand Joulin and Piotr Bojanowski},
journal= {arXiv preprint arXiv:2304.07193},
year = {2024}
}