从原型到通用分布:一种高效的掩码图像建模课程学习策略
计算机视觉与模式识别
2025-06-09 v2
摘要
掩码图像建模(MIM)已成为视觉表示学习的一种强大的自监督学习范式,使模型能够通过从图像的可见区域预测被掩码的部分来获取丰富的视觉表示。尽管这种方法已显示出有希望的结果,但我们假设其有效性可能受到早期训练阶段优化挑战的限制,在该阶段,模型被期望在尚未发展出基本视觉处理能力之前,就从部分观测中学习复杂的图像分布。为解决这一限制,我们提出了一种原型驱动的课程学习框架,该框架将学习过程结构化,使其从数据集中的原型示例逐步过渡到更复杂的变体。我们的方法引入了一种基于温度的退火方案,该方案逐渐扩展训练分布,从而实现更稳定、更高效的学习轨迹。通过在 ImageNet-1K 上的大量实验,我们证明,与标准的掩码自动编码相比,我们的课程学习策略显著提高了训练效率和表示质量,同时所需的训练周期数大幅减少。我们的发现表明,精心控制训练样本的顺序在自监督视觉学习中起着至关重要的作用,为掩码图像建模中的早期优化挑战提供了一个实用的解决方案。
引用
@article{arxiv.2411.10685,
title = {From Prototypes to General Distributions: An Efficient Curriculum for Masked Image Modeling},
author = {Jinhong Lin and Cheng-En Wu and Huanran Li and Jifan Zhang and Yu Hen Hu and Pedro Morgado},
journal= {arXiv preprint arXiv:2411.10685},
year = {2025}
}
备注
Accepted to CVPR2025