一种用于视觉表征学习的简单、高效且可扩展的对比掩码自编码器
计算机视觉与模式识别
2022-11-01 v1 机器学习
摘要
我们提出 CAN,一种用于视觉表征自监督学习的简单、高效且可扩展的方法。我们的框架是对 (C) 对比学习、(A) 掩码自编码器以及 (N) 扩散模型中使用的噪声预测方法的最小且概念清晰的合成。这些学习机制互为补充:对比学习在一批图像样本上塑造嵌入空间;掩码自编码器专注于单张图像样本中低频空间相关性的重建;而噪声预测鼓励图像高频分量的重建。组合方法产生了一种鲁棒、可扩展且易于实现的算法。训练过程是对称的,两个视图中均有 50% 的块被随机掩码,相比先前的对比学习方法带来了显著的效率提升。广泛的实证研究表明,CAN 在迁移学习与鲁棒性任务的线性与微调评估下均取得强劲的下游性能。在 ImageNet 上预训练时 CAN 优于 MAE 和 SimCLR,但在更大的未整理数据集(如 JFT-300M)上预训练时尤为有用:对于 ImageNet 上的线性探测,CAN 达到 75.4%,而 SimCLR 为 73.4%,MAE 为 64.1%。我们 ViT-L 模型在 ImageNet 上的微调性能为 86.1%,相比之下 SimCLR 为 85.5%,MAE 为 85.4%。SimCLR 的总体 FLOPs 负载对于 ViT-L 模型比 CAN 高 70%。
引用
@article{arxiv.2210.16870,
title = {A simple, efficient and scalable contrastive masked autoencoder for learning visual representations},
author = {Shlok Mishra and Joshua Robinson and Huiwen Chang and David Jacobs and Aaron Sarna and Aaron Maschinot and Dilip Krishnan},
journal= {arXiv preprint arXiv:2210.16870},
year = {2022}
}
备注
Mishra and Robinson contributed equally