SRMAE:面向尺度不变深度表示的掩码图像建模
计算机视觉与模式识别
2023-08-21 v1
摘要
由于自然图像中尺度方差的普遍性,我们提出将图像尺度作为掩码图像建模(MIM)的自监督信号。我们的方法从输入图像中随机选取图像块并将其下采样为低分辨率格式。我们的框架利用超分辨率(SR)的最新进展来设计预测头,从低分辨率线索和其他图像块重建输入。经过 400 轮预训练,我们的超分辨率掩码自编码器(SRMAE)在 ImageNet-1K 任务上取得了 82.1% 的准确率。图像尺度信号还使我们的 SRMAE 能够捕获尺度不变表示。对于极低分辨率(VLR)识别任务,我们的模型取得了最佳性能,超越 DeriveNet 1.3%。我们的方法在识别低分辨率面部表情任务上也取得了 74.84% 的准确率,超越当前最先进的 FMD 9.48%。
引用
@article{arxiv.2308.08884,
title = {SRMAE: Masked Image Modeling for Scale-Invariant Deep Representations},
author = {Zhiming Wang and Lin Gu and Feng Lu},
journal= {arXiv preprint arXiv:2308.08884},
year = {2023}
}