中文

面向先进掩码自编码器学习的协作掩码与目标动态组合

计算机视觉与模式识别 2024-12-24 v1 人工智能 机器学习 图像与视频处理 信号处理

摘要

掩码自编码器(MAE)最近在自监督视觉表示学习中取得了成功。以往工作主要应用自定义设计(如随机、块状)掩码或由教师(如CLIP)引导的掩码和目标。然而,这些方法忽略了自训练(学生)模型在为教师提供掩码和目标反馈方面的潜在作用。在本工作中,我们提出将协作掩码和目标集成到掩码自编码器中,称为CMT-MAE。具体而言,CMT-MAE通过来自教师和学生模型注意力的线性聚合,利用简单的协作掩码机制。我们进一步提议将这两个模型的输出特征作为解码器的协作目标。该简单且有效的框架在ImageNet-1K上进行预训练,实现了最先进的线性探测和微调性能。特别地,使用ViT-base,我们将vanilla MAE的微调结果从83.6%提升到85.7%。

关键词

引用

@article{arxiv.2412.17566,
  title  = {The Dynamic Duo of Collaborative Masking and Target for Advanced Masked Autoencoder Learning},
  author = {Shentong Mo},
  journal= {arXiv preprint arXiv:2412.17566},
  year   = {2024}
}