TiC-CLIP:CLIP 模型的持续训练
计算机视觉与模式识别
2024-03-22 v3 计算与语言
机器学习
摘要
使大型基础模型在最新数据上保持更新 inherently 代价高昂。为避免不断重训的 prohibitive 成本,持续训练这些模型至关重要。缺乏任何大规模持续学习基准或基线使该问题加剧。我们引入第一组用于训练视觉-语言模型的网络规模时间持续(TiC)基准:TiC-DataComp、TiC-YFCC 和 TiC-Redcaps。我们最大的数据集 TiC-DataComp 包含超过 12.7B 带时间戳的图像-文本对,跨度 9 年(2014-2022)。我们首先用基准策划各种动态评估以衡量现有模型的时间鲁棒性。我们展示 OpenAI 的 CLIP(训练数据截至 2020 年)在我们策划的 2021-2022 检索任务上零样本准确率比 OpenCLIP 仓库中较近期训练的模型损失约 8%。然后我们研究如何在时间连续数据上高效训练模型。我们证明一种简单的基于排练的方法,从最后检查点继续训练并重放旧数据,与从头重训的标准做法相比将计算量降低 2.5 倍。代码见 https://github.com/apple/ml-tic-clip。
引用
@article{arxiv.2310.16226,
title = {TiC-CLIP: Continual Training of CLIP Models},
author = {Saurabh Garg and Mehrdad Farajtabar and Hadi Pouransari and Raviteja Vemulapalli and Sachin Mehta and Oncel Tuzel and Vaishaal Shankar and Fartash Faghri},
journal= {arXiv preprint arXiv:2310.16226},
year = {2024}
}
备注
ICLR 2024