中文

MILAN:基于语言辅助表征的掩码图像预训练

计算机视觉与模式识别 2022-12-21 v3 计算与语言 机器学习

摘要

基于自注意力的 transformer 模型在过去几年中主导了许多计算机视觉任务。其优异的模型质量严重依赖于超大规模标注图像数据集。为减少对大型标注数据集的依赖,基于重建的掩码自编码器正日益流行,其从未标注图像中学习高质量可迁移表征。出于同样目的,近期的弱监督图像预训练方法利用图像所附文本描述中的语言监督。本工作中,我们提出基于语言辅助表征的掩码图像预训练,称为 MILAN。我们的预训练目标不是预测原始像素或低层特征,而是重建利用描述监督获得的、带有显著语义信号的图像特征。此外,为适配我们的重建目标,我们提出了更有效的提示解码器架构与语义感知掩码采样机制,进一步提升了预训练模型的迁移性能。实验结果表明,MILAN 取得了高于以往工作的准确率。当掩码自编码器在 ImageNet-1K 数据集上以 224x224 输入分辨率进行预训练与微调时,MILAN 在 ViT-Base 上达到 85.4% 的 top-1 准确率,超越先前 SOTA 1%。在下游语义分割任务中,MILAN 在 ADE20K 数据集上使用 ViT-Base 取得 52.7 mIoU,优于先前掩码预训练结果 4 个点。

关键词

引用

@article{arxiv.2208.06049,
  title  = {MILAN: Masked Image Pretraining on Language Assisted Representation},
  author = {Zejiang Hou and Fei Sun and Yen-Kuang Chen and Yuan Xie and Sun-Yuan Kung},
  journal= {arXiv preprint arXiv:2208.06049},
  year   = {2022}
}

备注

add new experiments and improved results. provide repo link