简化 CLIP:在消费级计算机上发挥大规模模型的潜力
机器学习
2025-01-14 v2 计算机视觉与模式识别
摘要
对比式语言-图像预训练 (CLIP) 因其卓越的零样性能和对下游任务的优异可迁移性而引发热潮。然而,这类大规模模型的训练通常需要大量计算和存储资源,这对一般用户(尤其是使用消费级计算机的用户)构成了障碍。为了解决这一问题,本文研究如何仅使用一台 Nvidia RTX3090 GPU 和 1TB 存储数据集即可实现竞争性能。一方面,我们简化了 transformer 块结构,并结合 Weight Inheritance 与多阶段知识蒸馏 (WIKD),从而减少参数量,提高训练期间和部署时的推理速度。另一方面,面对小数据集带来的收敛挑战,我们为每个样本生成合成标题作为数据增强,并提出一种新颖的配对匹配 (PM) 损失,充分利用正负图像-文本对之间的区别性。大量实验表明,我们的模型实现了参数-精度-规模之间的新型最佳权衡,这有助于在相关研究社区中普及 CLIP 模型。
引用
@article{arxiv.2411.14789,
title = {Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers},
author = {Hongbo Liu},
journal= {arXiv preprint arXiv:2411.14789},
year = {2025}
}