随机位置嵌入改进掩码图像建模
计算机视觉与模式识别
2024-02-28 v2 人工智能
机器学习
摘要
掩码图像建模(MIM)是一种有前景的自监督学习方法,能够从无标签图像中学习。尽管近期取得成功,通过 MIM 学习良好表征仍具挑战性,因为它需要预测准确位置上的正确语义内容。例如,给定一张不完整的狗的图像,我们可以猜到有尾巴,但无法确定其确切位置。在本工作中,我们提出通过使用随机位置嵌入(StoP)将位置不确定性引入 MIM。具体而言,我们以从高斯分布抽取的随机掩码 token 位置为条件。StoP 减少了对位置特征的过拟合,并引导模型学习对位置不确定性更鲁棒的特徴。在定量上,StoP 在多种下游任务上提升了下游 MIM 性能,包括使用 ViT-B 的 ImageNet 线性探测提升 ,以及使用 数据 ViT-H 提升 。
引用
@article{arxiv.2308.00566,
title = {Stochastic positional embeddings improve masked image modeling},
author = {Amir Bar and Florian Bordes and Assaf Shocher and Mahmoud Assran and Pascal Vincent and Nicolas Ballas and Trevor Darrell and Amir Globerson and Yann LeCun},
journal= {arXiv preprint arXiv:2308.00566},
year = {2024}
}
备注
Code and models available in https://github.com/amirbar/StoP