突破开放权重CLIP的极限:一种自监督微调CLIP的优化框架
计算机视觉与模式识别
2026-01-16 v1 机器学习
摘要
CLIP已成为多模态表示学习的基石,然而提升其性能通常需要从零开始在数十亿样本上进行训练,这一过程成本高昂。我们提出了一个不同的问题:能否仅使用现有的自监督数据集来提升开放权重CLIP模型在各种下游任务上的性能?与将预训练模型适配到单一下游任务的有监督微调不同,我们的设定旨在提升跨多种任务的通用性能。然而,正如我们的实验和先前的研究所揭示的那样,从开放权重CLIP模型开始简单地应用标准训练协议往往会失败,导致性能下降。在本文中,我们引入了TuneCLIP,这是一个克服性能下降的自监督微调框架。TuneCLIP包含两个关键组成部分:(1) 一个恢复优化统计量的预热阶段,以减少冷启动偏差,其设计受理论分析启发;(2) 一个优化新型对比损失的微调阶段,以减轻对假阴性对的惩罚。我们的大量实验表明,TuneCLIP在不同模型架构和规模上均能持续提升性能。值得注意的是,它提升了像SigLIP (ViT-B/16)这样的领先开放权重模型,在ImageNet及相关分布外基准上实现了高达+2.5%的增益,在竞争激烈的DataComp基准上实现了+1.2%的增益,为高效的后预训练适配设立了新的强大基线。
引用
@article{arxiv.2601.09859,
title = {Breaking the Limits of Open-Weight CLIP: An Optimization Framework for Self-supervised Fine-tuning of CLIP},
author = {Anant Mehta and Xiyuan Wei and Xingyu Chen and Tianbao Yang},
journal= {arXiv preprint arXiv:2601.09859},
year = {2026}
}
备注
Submitted to ICLR 2026