中文

iBOT:基于在线分词器的图像 BERT 预训练

计算机视觉与模式识别 2022-01-28 v3

摘要

语言 Transformer 的成功主要归功于掩码语言建模(MLM)这一 pretext task(预训练任务),其中文本首先被分词为具有语义意义的片段。在本工作中,我们研究掩码图像建模(MIM),并指出使用具有语义意义的视觉分词器的优势与挑战。我们提出一种自监督框架 iBOT,其可利用在线分词器执行掩码预测。具体而言,我们对掩码图像块 token 进行自蒸馏,并将教师网络作为在线分词器,同时对类 token 进行自蒸馏以获取视觉语义。该在线分词器与 MIM 目标联合可学习,从而免去了需预先训练分词器的多阶段训练流程。我们在 ImageNet-1K 上取得了 82.3% 的线性探测准确率和 87.8% 的微调准确率,由此彰显了 iBOT 的优越性。除最先进的图像分类结果外,我们揭示了涌现的局部语义模式,这有助于模型获得针对常见 corruptions(扰动)的强鲁棒性,并在密集下游任务(如目标检测、实例分割和语义分割)上取得领先结果。

关键词

引用

@article{arxiv.2111.07832,
  title  = {iBOT: Image BERT Pre-Training with Online Tokenizer},
  author = {Jinghao Zhou and Chen Wei and Huiyu Wang and Wei Shen and Cihang Xie and Alan Yuille and Tao Kong},
  journal= {arXiv preprint arXiv:2111.07832},
  year   = {2022}
}