CL-MAE:课程学习的掩码自编码器
计算机视觉与模式识别
2024-02-29 v3 人工智能
机器学习
摘要
掩码图像建模已被证明是一种强大的 pretext 任务,可生成鲁棒的表征,并有效泛化到多个下游任务。通常,该方法随机掩码输入图像中的图像块(token),且掩码策略在训练期间保持不变。本文提出一种课程学习方法,更新掩码策略以持续提升自监督重建任务的复杂度。我们推测,通过逐步增加任务复杂度,模型可学习到更精细且可迁移的表征。为此,我们引入一种新颖的可学习掩码模块,能够生成不同复杂度的掩码,并将该模块集成到掩码自编码器(MAE)中。我们的模块与 MAE 联合训练,同时在训练过程中调整其行为:从 MAE 的伙伴(优化相同的重建损失)过渡到对手(优化相反损失),并经过一个中性状态。这些行为间的过渡是平滑的,由乘以掩码模块重建损失的一个因子调控。所得训练流程生成了由易到难的课程。我们在 ImageNet 上训练我们的课程学习掩码自编码器(CL-MAE),并表明其相比 MAE 展现出更优的表征学习能力。在五个下游任务上的实证结果证实了我们的推测,证明课程学习可成功用于自监督掩码自编码器。我们的代码发布于 https://github.com/ristea/cl-mae。
引用
@article{arxiv.2308.16572,
title = {CL-MAE: Curriculum-Learned Masked Autoencoders},
author = {Neelu Madan and Nicolae-Catalin Ristea and Kamal Nasrollahi and Thomas B. Moeslund and Radu Tudor Ionescu},
journal= {arXiv preprint arXiv:2308.16572},
year = {2024}
}
备注
Accepted at WACV 2024