中文

像预训练一样微调:零样本视觉模型的改进微调方法

计算机视觉与模式识别 2022-12-02 v1 机器学习

摘要

微调如 CLIP 之类的图像-文本模型在多种基准上取得了最先进的准确率。然而,WiseFT(Wortsman 等人,2021)与 LP-FT(Kumar 等人,2022)等近期工作表明,即便微调过程中细微的差异,也会对分布内(ID)与分布外(OOD)数据的最终性能造成出人意料的大幅差异。本文中,我们展示一种模仿对比预训练的自然且简单的方法始终优于其他替代微调方法。具体而言,我们将下游类别标签转换为文本提示,并继续优化图像嵌入与类别描述性提示嵌入之间的对比损失(对比微调)。我们的方法在 7 个分布偏移、6 个迁移学习及 3 个小样本学习基准上始终优于基线。在 WILDS-iWILDCam 上,我们提出的方法 FLYP 以 ID 高 2.3%2.3\% 、OOD 高 2.7%2.7\% 优于排行榜首位,给出最高报道准确率。在 7 个 OOD 数据集(2 个 WILDS 与 5 个 ImageNet 相关偏移)上平均,FLYP 相对标准微调取得 4.2%4.2\% 的 OOD 提升,并在 ID 与 OOD 上均以超过 1%1\% 的优势优于当前最优(LP-FT)。类似地,在 3 个小样本学习基准上,我们的方法相对标准微调取得最高 4.6%4.6\% 的提升,相对最优方法取得 4.4%4.4\% 的提升。总体而言,这些基准确立了对比微调作为如 CLIP 等图像-文本模型监督微调的一种简单、直观且最先进的方法。代码见 https://github.com/locuslab/FLYP。

关键词

引用

@article{arxiv.2212.00638,
  title  = {Finetune like you pretrain: Improved finetuning of zero-shot vision models},
  author = {Sachin Goyal and Ananya Kumar and Sankalp Garg and Zico Kolter and Aditi Raghunathan},
  journal= {arXiv preprint arXiv:2212.00638},
  year   = {2022}
}

备注

20 Pages, 7 Tables, 5 Figures