中文

对比微调:一点助力使掩码自编码器遗忘

计算机视觉与模式识别 2023-09-15 v2 人工智能 机器学习

摘要

掩码图像建模 (MIM) 方法,如 Masked Autoencoders (MAE),高效地学习了输入丰富的表示。然而,对于适应下游任务,它们需要足够数量的标注数据,因为其丰富特征不仅编码了对象,还编码了相关性较低的图像背景。相比之下,实例判别 (ID) 方法聚焦于对象。在这项工作中,我们研究如何结合 MIM 的效率和可扩展性,以及 ID 在缺乏大量标注数据时执行下游分类的能力。为此,我们引入了 Masked Autoencoder Contrastive Tuning (MAE-CT),这是一种顺序方法,利用 Nearest Neighbor Contrastive Learning (NNCLR) 目标的隐式聚类来诱导预训练 MAE 最顶层的抽象。MAE-CT 在不使用任何标签的情况下调整丰富特征,使其形成对象的语义簇。值得注意的是,MAE-CT 不依赖于手工制作的增强,并且经常仅使用最小增强(裁剪和翻转)就达到最佳性能。此外,MAE-CT 计算高效,因为与 MAE 重新训练相比,它最多需要 10% 的开销。应用于大型和巨型 Vision Transformer (ViT) 模型时,MAE-CT 在线性探测、k-NN 和低样本分类精度以及无监督聚类精度上优于之前在 ImageNet 上训练的自监督方法。使用 ViT-H/16,MAE-CT 在线性探测中达到了 82.2% 的新的最先进水平。

关键词

引用

@article{arxiv.2304.10520,
  title  = {Contrastive Tuning: A Little Help to Make Masked Autoencoders Forget},
  author = {Johannes Lehner and Benedikt Alkin and Andreas Fürst and Elisabeth Rumetshofer and Lukas Miklautz and Sepp Hochreiter},
  journal= {arXiv preprint arXiv:2304.10520},
  year   = {2023}
}