MobileCLIP:通过多模态增强训练实现快速图像-文本模型
计算机视觉与模式识别
2024-04-02 v2 计算与语言
机器学习
摘要
图像-文本基础模型(如 CLIP)的对比预训练在广泛的下游任务上展现了优异的零样本性能与鲁棒性。然而,这些模型采用基于 transformer 的大型编码器,具有显著的内存与延迟开销,给移动设备部署带来挑战。本文引入 MobileCLIP——一个为运行时性能优化的高效图像-文本模型系列,以及一种新颖高效的训练方法,即多模态增强训练(multi-modal reinforced training)。所提出的训练方法利用来自图像描述模型和一个强 CLIP 编码器集成体的知识迁移来提升高效模型的精度。我们的方法通过将额外知识存储在增强数据集中,避免了训练时的计算开销。MobileCLIP 在多个数据集的零样本分类与检索任务上确立了新的最先进延迟-精度权衡。我们的 MobileCLIP-S2 变体相比此前基于 ViT-B/16 的最佳 CLIP 模型快 2.3 且更精确。我们进一步通过训练基于 ViT-B/16 图像骨干的 CLIP 模型验证了多模态增强训练的有效性,在 38 个评估基准上相比此前最佳平均性能提升 +2.9%。此外,我们表明所提方法相比非增强 CLIP 训练实现了 10-1000 的学习效率提升。代码与模型见 https://github.com/apple/ml-mobileclip 。
引用
@article{arxiv.2311.17049,
title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
author = {Pavan Kumar Anasosalu Vasu and Hadi Pouransari and Fartash Faghri and Raviteja Vemulapalli and Oncel Tuzel},
journal= {arXiv preprint arXiv:2311.17049},
year = {2024}
}
备注
CVPR 2024