中文

DINOv3

计算机视觉与模式识别 2025-08-15 v1 机器学习

摘要

自监督学习有望消除对手动数据标注的需求,使模型能够轻松扩展至大规模数据集和更大的架构。通过不针对特定任务或领域进行针对性设计,这种训练范式有望从多样化的数据源(从自然图像到航空图像)中学习视觉表征——仅使用一个算法。本技术报告介绍 DINOv3,这是实现这一愿景的重要里程碑,通过利用简单且有效的策略来实现。首先,我们利用扩大数据集和模型规模的优势,通过谨慎的数据准备、设计和优化。其次,我们引入一种新方法称为 Gram 锚定 (Gram anchoring),有效解决密集特征图在长期训练期间退化的问题。最后,我们应用后处理策略进一步提升模型对分辨率、模型规模以及与文本对齐的灵活性。结果是,我们呈现了一个 versatile 的视觉基础模型,在广泛的设置下无需微调即可超过专门的 state of the art。DINOv3 产生的高质量稠密特征在各种视觉任务上实现卓越的性能,显著超越了之前的自监督和弱监督基础模型。我们也分享 DINOv3 视觉模型套件,旨在通过提供可扩展的解决方案来推动该模型在广泛任务和数据上的 state of the art。

关键词

引用

@article{arxiv.2508.10104,
  title  = {DINOv3},
  author = {Oriane Siméoni and Huy V. Vo and Maximilian Seitzer and Federico Baldassarre and Maxime Oquab and Cijo Jose and Vasil Khalidov and Marc Szafraniec and Seungeun Yi and Michaël Ramamonjisoa and Francisco Massa and Daniel Haziza and Luca Wehrstedt and Jianyuan Wang and Timothée Darcet and Théo Moutakanni and Leonel Sentana and Claire Roberts and Andrea Vedaldi and Jamie Tolan and John Brandt and Camille Couprie and Julien Mairal and Hervé Jégou and Patrick Labatut and Piotr Bojanowski},
  journal= {arXiv preprint arXiv:2508.10104},
  year   = {2025}
}