中文

DIME-FM:蒸馏多模态高效基础模型

计算机视觉与模式识别 2023-08-16 v2

摘要

大型视觉-语言基础模型(VLFM),如CLIP、ALIGN和Florence,在大规模图像-描述对数据集上训练,并在下游任务上展现出优越的迁移性与鲁棒性,但由于其规模大、延迟高和架构固定,难以在许多实际应用中使用。遗憾的是,近期研究表明,利用公共和较小规模数据训练用于资源受限应用的小型定制VLFM目前非常困难。本文中,我们引入一种新的蒸馏机制(DIME-FM),使我们能够利用相对较少量的廉价、未配对图像和句子,将大型VLFM中包含的知识迁移到更小的定制基础模型中。我们将预训练的CLIP-ViTL/14模型的知识迁移到ViT-B/32模型,仅使用了4000万张公共图像和2840万条未配对公共句子。所得模型“Distill-ViT-B/32”可与在其私有WiT数据集(4亿图像-文本对)上预训练的CLIP-ViT-B/32模型相媲美:Distill-ViT-B/32在ImageNet和ELEVATER(20个图像分类任务)基准上的零样本和线性探测性能方面取得了相似结果。在五个具有来自ImageNet的自然分布偏移的数据集上评估时,它也显示出相当的鲁棒性。

关键词

引用

@article{arxiv.2303.18232,
  title  = {DIME-FM: DIstilling Multimodal and Efficient Foundation Models},
  author = {Ximeng Sun and Pengchuan Zhang and Peizhao Zhang and Hardik Shah and Kate Saenko and Xide Xia},
  journal= {arXiv preprint arXiv:2303.18232},
  year   = {2023}
}

备注

Accepted to ICCV 2023