基于多级优化的掩码自编码器中下游任务引导的掩码学习
计算机视觉与模式识别
2025-03-25 v2 机器学习
摘要
掩码自编码器(MAE)是视觉表示学习中一种显著的自监督预训练方法。它通过随机掩码图像块并使用未掩码的块重建这些被掩码的块来工作。MAE的一个关键局限性在于它忽略了不同块的信息量差异,因为它统一地选择要掩码的块。为了克服这一点,一些方法提出了基于块信息量的掩码策略。然而,这些方法通常不考虑下游任务的具体要求,可能导致为这些任务生成次优的表示。为此,我们引入了多级优化掩码自编码器(MLO-MAE),这是一种新颖的框架,它利用来自下游任务的端到端反馈,在预训练期间学习最优的掩码策略。我们的实验结果突显了MLO-MAE在视觉表示学习方面的显著进步。与现有方法相比,它在不同的数据集和任务上均展现出显著的改进,展示了其适应性和效率。
引用
@article{arxiv.2402.18128,
title = {Downstream Task Guided Masking Learning in Masked Autoencoders Using Multi-Level Optimization},
author = {Han Guo and Ramtin Hosseini and Ruiyi Zhang and Sai Ashish Somayajula and Ranak Roy Chowdhury and Rajesh K. Gupta and Pengtao Xie},
journal= {arXiv preprint arXiv:2402.18128},
year = {2025}
}
备注
Published in Transactions on Machine Learning Research (TMLR)