中文

三塔:利用预训练图像模型进行灵活的对比学习

计算机视觉与模式识别 2023-10-31 v3 人工智能 机器学习

摘要

我们提出三塔(Three Towers, 3T),一种通过引入预训练图像分类器来改进视觉-语言模型对比学习的灵活方法。虽然对比模型通常从零开始训练,但LiT(Zhai et al., 2022)近期展示了使用预训练分类器嵌入所带来的性能提升。然而,LiT直接用冻结的嵌入替换图像塔,排除了图像塔通过对比训练获得潜在收益的可能。通过3T,我们提出了一种更灵活的策略,使图像塔能同时受益于预训练嵌入和对比训练。为此,我们引入了包含冻结预训练嵌入的第三塔,并鼓励该第三塔与主图像-文本塔之间对齐。在经验上,3T在检索任务上持续优于LiT和CLIP风格的从零基线。对于分类,3T可靠地优于从零基线;虽然对于JFT预训练模型其表现不及LiT,但在ImageNet-21k和Places365预训练下优于LiT。

关键词

引用

@article{arxiv.2305.16999,
  title  = {Three Towers: Flexible Contrastive Learning with Pretrained Image Models},
  author = {Jannik Kossen and Mark Collier and Basil Mustafa and Xiao Wang and Xiaohua Zhai and Lucas Beyer and Andreas Steiner and Jesse Berent and Rodolphe Jenatton and Efi Kokiopoulou},
  journal= {arXiv preprint arXiv:2305.16999},
  year   = {2023}
}

备注

Accepted for publication at NeurIPS 2023