中文

掩码图像建模的统一视角

计算机视觉与模式识别 2022-10-20 v1

摘要

掩码图像建模已展现出消除大规模视觉 Transformer 训练中对标签依赖问题的巨大潜力,并在各类下游任务上取得了令人印象深刻的性能。在本工作中,我们在重新审视现有方法后提出了一种掩码图像建模的统一视角。在该统一视角下,我们引入了一种简单而有效的方法,称为 MaskDistill,其在掩码位置基于受损输入图像重建来自教师模型的归一化语义特征。在图像分类与语义分割上的实验结果表明,MaskDistill 取得了与最先进方法相当或更优的性能。当使用 huge 视觉 Transformer 并预训练 300 个 epoch 时,MaskDistill 在 ImageNet-1k(224 尺寸)上获得了 88.3% 的微调 top-1 准确率,在 ADE20k(512 尺寸)上获得了 58.8% 的语义分割 mIoU 指标。代码与预训练模型将发布于 https://aka.ms/unimim。

关键词

引用

@article{arxiv.2210.10615,
  title  = {A Unified View of Masked Image Modeling},
  author = {Zhiliang Peng and Li Dong and Hangbo Bao and Qixiang Ye and Furu Wei},
  journal= {arXiv preprint arXiv:2210.10615},
  year   = {2022}
}