用于自监督视觉预训练的损坏图像建模
计算机视觉与模式识别
2023-03-17 v2 人工智能
机器学习
摘要
我们引入了用于自监督视觉预训练的损坏图像建模(CIM)。CIM 使用一个带有小型可训练 BEiT 的辅助生成器来损坏输入图像,而非使用人工 [MASK] 令牌,其中一些图像块被随机选中并替换为从 BEiT 输出分布中采样的合理替代样本。给定此损坏图像,一个增强网络学习恢复所有原始图像像素,或预测每个视觉令牌是否被生成器样本替换。生成器与增强网络被同时训练并协同更新。预训练后,增强网络可用作面向下游任务的高容量视觉编码器。CIM 是一个通用且灵活的视觉预训练框架,适用于多种网络架构。CIM 首次证明了 ViT 与 CNN 均可使用统一的非孪生框架学习丰富的视觉表示。实验结果表明,我们的方法在视觉基准(如 ImageNet 分类与 ADE20K 语义分割)上取得了引人注目的结果。
引用
@article{arxiv.2202.03382,
title = {Corrupted Image Modeling for Self-Supervised Visual Pre-Training},
author = {Yuxin Fang and Li Dong and Hangbo Bao and Xinggang Wang and Furu Wei},
journal= {arXiv preprint arXiv:2202.03382},
year = {2023}
}
备注
ICLR 2023