中文

RevColV2:在掩码图像建模中探索解耦表征

计算机视觉与模式识别 2023-09-06 v1

摘要

掩码图像建模(MIM)已成为视觉基础模型一种普遍的预训练设置,并取得了令人满意的性能。尽管取得成功,现有的 MIM 方法在下游应用中丢弃了解码器网络,导致预训练与微调之间的表征不一致,并可能妨碍下游任务性能。在本文中,我们提出了一种新架构 RevColV2,它通过在前训练和微调阶段均保留完整的自编码器架构来解决此问题。RevColV2 的主体包含自下而上和自上而下的列,信息在这些列之间可逆传播并逐步解耦。这样的设计使我们的架构具备一个良好特性:在 MIM 预训练的网络末端保持解耦的低层信息与语义信息。我们的实验结果表明,具有解耦特征的基础模型能够在多个下游视觉任务(如图像分类、语义分割和目标检测)上取得有竞争力的性能。例如,在 ImageNet-22K 数据集上经过中间微调后,RevColV2-L 在 ImageNet-1K 分类上达到 88.4% 的 top-1 准确率,在 ADE20K 语义分割上达到 58.6 mIoU。借助额外的教师模型与大规模数据集,RevColV2-L 在 COCO 检测上达到 62.1 box AP,在 ADE20K 语义分割上达到 60.4 mIoU。代码与模型发布于 https://github.com/megvii-research/RevCol

关键词

引用

@article{arxiv.2309.01005,
  title  = {RevColV2: Exploring Disentangled Representations in Masked Image Modeling},
  author = {Qi Han and Yuxuan Cai and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2309.01005},
  year   = {2023}
}