极端掩码:用于学习实例与分布式视觉表示
计算机视觉与模式识别
2023-03-09 v2
摘要
本文提出一种可扩展方法,用于同时学习单个令牌上的空间分布式视觉表示与整体实例表示。我们使用自注意力块表示空间分布式令牌,随后通过交叉注意力块聚合整体图像实例。该方法的核心是将极大令牌掩码(75%–90%)作为监督的数据增强。我们的模型名为ExtreMA,遵循朴素的BYOL方法,即从未掩码子集得到的实例表示被训练以预测完整输入的实例表示。模型不被鼓励跨输入不变,而是被要求捕捉图像中的信息性变化。本文作出三点贡献:1)提出随机掩码作为一种强大且计算高效的数据增强,用于孪生表示学习。2)通过每实例多次采样,极端掩码大幅加速学习并以更多数据提升性能。3)ExtreMA取得比掩码建模方法更强的线性探测性能,以及比先前对比模型更好的迁移性能。
引用
@article{arxiv.2206.04667,
title = {Extreme Masking for Learning Instance and Distributed Visual Representations},
author = {Zhirong Wu and Zihang Lai and Xiao Sun and Stephen Lin},
journal= {arXiv preprint arXiv:2206.04667},
year = {2023}
}
备注
Accepted in TMLR