中文

MobileCLIP2:改进多模态强化训练

计算机视觉与模式识别 2025-08-29 v1 人工智能 计算与语言 机器学习

摘要

基石级图像-文本模型如 CLIP 具备零样态能力,支持广泛的应用。MobileCLIP 是一系列在 3-15ms 延迟和 50-150M 参数规模下,具备最佳零样态准确性的图像-文本模型。MobileCLIP 的核心要素在于其低延迟轻量化架构以及一种新颖的多模态强化训练方式,使从多个caption生成器和 CLIP 教师进行知识蒸馏变得高效、可扩展且可复现。在本文中,我们通过以下方式改进 MobileCLIP 的多模态强化训练:1)使用在 DFN 数据集上训练的更优 CLIP 教师集成方案,2)在 DFN 数据集上训练改进的caption教师,并在多样化的高质量图像-caption 数据集上进行微调。我们通过消融实验发现:在对比知识蒸馏中调节温度参数的重要性、caption生成器微调以提升caption多样性的有效性,以及结合多个模型生成的合成caption的叠加性提升。我们训练了新的一系列模型 MobileCLIP2,在低延迟下实现了 ImageNet-1k 零样态准确率的提升。特别地,MobileCLIP2-B 相比 MobileCLIP-B 架构在 ImageNet-1k 准确率上提升了 2.2%。值得注意的是,MobileCLIP2-S4 在 ImageNet-1k 上的零样态准确率与 SigLIP-SO400M/14 相当,却小 2 倍,在 DFN ViT-L/14 上的性能提升了 2.5 倍的延迟。我们发布了预训练模型(https://github.com/apple/ml-mobileclip)和数据生成代码(https://github.com/apple/ml-mobileclip-dr)。数据生成代码简化了使用分布式可扩展处理创建新强化数据集的便捷性。

关键词

引用

@article{arxiv.2508.20691,
  title  = {MobileCLIP2: Improving Multi-Modal Reinforced Training},
  author = {Fartash Faghri and Pavan Kumar Anasosalu Vasu and Cem Koc and Vaishaal Shankar and Alexander Toshev and Oncel Tuzel and Hadi Pouransari},
  journal= {arXiv preprint arXiv:2508.20691},
  year   = {2025}
}

备注

TMLR August 2025