用于增强视觉自监督学习的频率引导掩码
计算机视觉与模式识别
2025-04-01 v3
摘要
我们提出了一种新颖的基于频率的自监督学习 (Self-Supervised Learning, SSL) 方法,显著增强了预训练的有效性。先前在此方向的工作掩蔽掉输入图像中预定义的频率,并采用重建损失来预训练模型。虽然取得了有希望的结果,但正如我们在本文中所指出的,这种实现存在两个根本局限。首先,使用预定义的频率忽略了图像频率响应的变异性。其次,使用频率滤波后的图像进行预训练,导致所得模型在微调期间需要相对更多的数据来适应自然外观的图像。为了解决这些缺陷,我们提出了结合自知识蒸馏的傅里叶变换压缩 (FOurier transform compression with seLf-Knowledge distillation, FOLK),融合了两个专门的想法。首先,受图像压缩启发,我们根据图像频率响应自适应地选择被掩蔽的频率,为预训练创建更合适的 SSL 任务。其次,我们采用由知识蒸馏赋能的双分支框架,使模型能够同时将滤波后的图像和原始图像作为输入,大大减轻了下游任务的负担。我们的实验结果表明,FOLK 在包括图像分类、少样本学习和语义分割在内的各种下游任务中,取得了与许多最先进的 SSL 方法相当的性能,证明了其有效性。
引用
@article{arxiv.2409.10362,
title = {Frequency-Guided Masking for Enhanced Vision Self-Supervised Learning},
author = {Amin Karimi Monsefi and Mengxi Zhou and Nastaran Karimi Monsefi and Ser-Nam Lim and Wei-Lun Chao and Rajiv Ramnath},
journal= {arXiv preprint arXiv:2409.10362},
year = {2025}
}
备注
Accepted to ICLR 2025