聚类并预测潜在图像块以改进掩码图像建模
计算机视觉与模式识别
2025-07-01 v3 人工智能
摘要
掩码图像建模(MIM)为自监督表示学习提供了一种有前景的方法,然而现有的MIM模型仍落后于最先进水平。本文系统性地分析了目标表示、损失函数和架构,提出了CAPI——一种依赖于潜在聚类预测的新型纯MIM框架。我们的方法利用了一种基于聚类的损失,该损失训练稳定,并展现出良好的扩展特性。我们的ViT-L骨干网络CAPI在ImageNet上使用简单线性探针达到了83.8%的准确率,在ADE20K上达到了32.1%的mIoU,大幅超越了以往的MIM方法,并接近当前最先进模型DINOv2的性能。我们发布了所有代码和模型。
引用
@article{arxiv.2502.08769,
title = {Cluster and Predict Latent Patches for Improved Masked Image Modeling},
author = {Timothée Darcet and Federico Baldassarre and Maxime Oquab and Julien Mairal and Piotr Bojanowski},
journal= {arXiv preprint arXiv:2502.08769},
year = {2025}
}
备注
26 pages, 14 figures, accepted in TMLR 2025