中文

为卷积网络设计BERT:稀疏与分层掩码建模

计算机视觉与模式识别 2023-01-11 v2 人工智能 机器学习

摘要

我们识别并克服了将BERT风格预训练(即掩码图像建模)的成功扩展到卷积网络(convnets)的两个关键障碍:(i)卷积操作无法处理不规则的、随机掩码的输入图像;(ii)BERT预训练的单尺度性质与卷积网络的分层结构不一致。针对(i),我们将未掩码像素视为3D点云的稀疏体素并使用稀疏卷积进行编码。这是稀疏卷积在2D掩码建模中的首次使用。针对(ii),我们开发了分层解码器以从多尺度编码特征重建图像。我们称为稀疏掩码建模(SparK)的方法具有通用性:它可直接用于任何卷积模型而无需骨干修改。我们在经典(ResNet)和现代(ConvNeXt)模型上验证它:在三个下游任务上,它以相近的大幅度(约+1.0%)超越了最先进的对比学习和基于transformer的掩码建模。在目标检测和实例分割上的提升更为显著(高达+3.5%),验证了所学特征的强可迁移性。我们还通过观测更大模型上的更多增益发现了其良好的缩放行为。所有这些证据揭示了卷积网络上生成式预训练的光明前景。代码和模型发布于 https://github.com/keyu-tian/SparK。

关键词

引用

@article{arxiv.2301.03580,
  title  = {Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling},
  author = {Keyu Tian and Yi Jiang and Qishuai Diao and Chen Lin and Liwei Wang and Zehuan Yuan},
  journal= {arXiv preprint arXiv:2301.03580},
  year   = {2023}
}

备注

v2: fixed some formatting errors