中文

LiT:基于锁定图像文本调优的零样本迁移

计算机视觉与模式识别 2022-06-23 v3 计算与语言 机器学习

摘要

本文提出对比调优(contrastive-tuning),一种利用对比训练对齐图像与文本模型、同时仍发挥其预训练优势的简单方法。在我们的实证研究中发现,锁定预训练图像模型并解锁文本模型效果最佳。我们将这一对比调优的实例称为“锁定图像调优”(Locked-image Tuning,LiT),它仅教导文本模型从预训练图像模型中读出适用于新任务的良好表征。LiT模型获得了对新视觉任务(如图像分类或检索)的零样本迁移能力。所提出的LiT具有广泛适用性;它可可靠地用于多种预训练方法(有监督与无监督)以及不同架构(ResNet、Vision Transformers与MLP-Mixer),并使用三个不同的图像-文本数据集。基于Transformer的预训练ViT-g/14模型,LiT模型在ImageNet测试集上实现了85.2%的零样本迁移准确率,在具有挑战性的分布外ObjectNet测试集上实现了82.5%的准确率。

关键词

引用

@article{arxiv.2111.07991,
  title  = {LiT: Zero-Shot Transfer with Locked-image text Tuning},
  author = {Xiaohua Zhai and Xiao Wang and Basil Mustafa and Andreas Steiner and Daniel Keysers and Alexander Kolesnikov and Lucas Beyer},
  journal= {arXiv preprint arXiv:2111.07991},
  year   = {2022}
}

备注

Xiaohua, Xiao, Basil, Andreas and Lucas contributed equally; CVPR 2022