三塔:利用预训练图像模型进行灵活的对比学习
计算机视觉与模式识别
2023-10-31 v3 人工智能
机器学习
摘要
我们提出三塔(Three Towers, 3T),一种通过引入预训练图像分类器来改进视觉-语言模型对比学习的灵活方法。虽然对比模型通常从零开始训练,但LiT(Zhai et al., 2022)近期展示了使用预训练分类器嵌入所带来的性能提升。然而,LiT直接用冻结的嵌入替换图像塔,排除了图像塔通过对比训练获得潜在收益的可能。通过3T,我们提出了一种更灵活的策略,使图像塔能同时受益于预训练嵌入和对比训练。为此,我们引入了包含冻结预训练嵌入的第三塔,并鼓励该第三塔与主图像-文本塔之间对齐。在经验上,3T在检索任务上持续优于LiT和CLIP风格的从零基线。对于分类,3T可靠地优于从零基线;虽然对于JFT预训练模型其表现不及LiT,但在ImageNet-21k和Places365预训练下优于LiT。
引用
@article{arxiv.2305.16999,
title = {Three Towers: Flexible Contrastive Learning with Pretrained Image Models},
author = {Jannik Kossen and Mark Collier and Basil Mustafa and Xiao Wang and Xiaohua Zhai and Lucas Beyer and Andreas Steiner and Jesse Berent and Rodolphe Jenatton and Efi Kokiopoulou},
journal= {arXiv preprint arXiv:2305.16999},
year = {2023}
}
备注
Accepted for publication at NeurIPS 2023