mc-BEiT:面向图像 BERT 预训练的多选离散化
计算机视觉与模式识别
2022-07-29 v4
摘要
基于掩码图像建模(MIM)的图像 BERT 预训练已成为应对自监督表示学习的流行做法。开创性工作 BEiT 将 MIM 视为带有视觉词表的分类任务,使用预学习的 dVAE 将连续视觉信号离散化为离散视觉 token。尽管是一种可行方案,不恰当的离散化阻碍了图像预训练的进一步提升。由于图像离散化没有真值答案,我们认为即便可获得更好的 tokenizer,被掩码的补丁也不应被赋予唯一的 token id。本工作中,我们引入一种改进的 BERT 风格图像预训练方法,即 mc-BEiT,其面向简化且精炼的多选训练目标执行 MIM 代理任务。具体而言,被掩码图像补丁的多选监督由离散 token id 的软概率向量构成,这些向量由现成图像 tokenizer 预测并借助高层补丁间感知进一步精炼——基于相似补丁应共享其选择的观察。在分类、分割和检测任务上的大量实验证明了我们方法的优越性,例如预训练的 ViT-B 在 ImageNet-1K 分类上达到 84.1% 的 top-1 微调准确率,在 COCO 上目标检测与实例分割达到 49.2% AP^b 和 44.0% AP^m,在 ADE20K 语义分割上达到 50.8% mIOU,优于有竞争力的同类方法。代码将发布于 https://github.com/lixiaotong97/mc-BEiT。
引用
@article{arxiv.2203.15371,
title = {mc-BEiT: Multi-choice Discretization for Image BERT Pre-training},
author = {Xiaotong Li and Yixiao Ge and Kun Yi and Zixuan Hu and Ying Shan and Ling-Yu Duan},
journal= {arXiv preprint arXiv:2203.15371},
year = {2022}
}
备注
Accepted by ECCV 2022