Selfie:用于图像嵌入的自监督预训练
机器学习
2019-07-30 v3 计算机视觉与模式识别
图像与视频处理
机器学习
摘要
我们提出一种称为Selfie的预训练技术,其全称为SELFie supervised Image Embedding(自监督图像嵌入)。Selfie将BERT (Devlin et al., 2019)的掩码语言建模概念推广到连续数据(如图像),利用了对比预测编码损失 (Oord et al., 2018)。给定输入图像中被掩码的图块,我们的方法学习从同一图像中采样的其他“干扰”图块中选出正确的图块来填补掩码位置。该分类目标规避了预测目标图块精确像素值的需要。Selfie的预训练架构包括一个卷积块网络以处理图块,其后接一个注意力池化网络,在预测掩码图块之前对未掩码图块的内容进行汇总。在微调阶段,我们复用了预训练得到的卷积权重。我们在三个基准(CIFAR-10、ImageNet 32 x 32和ImageNet 224 x 224)上以不同量的标注数据(训练集的5%至100%)评估Selfie。相较于同一网络的标准监督训练,我们的预训练方法在所有设定下为ResNet-50带来了一致的提升。值得注意的是,在每类60个样本(5%)的ImageNet 224 x 224上,我们的方法将ResNet-50的平均准确率从35.6%提升至46.7%,绝对准确率提高11.1个百分点。我们的预训练方法还提升了ResNet-50的训练稳定性,尤其在低数据情形下,通过显著降低不同运行间测试准确率的标准差得以体现。
引用
@article{arxiv.1906.02940,
title = {Selfie: Self-supervised Pretraining for Image Embedding},
author = {Trieu H. Trinh and Minh-Thang Luong and Quoc V. Le},
journal= {arXiv preprint arXiv:1906.02940},
year = {2019}
}