中文

寥寥数词:从词袋监督中学习可迁移视觉模型

计算机视觉与模式识别 2022-01-07 v2

摘要

使用自然语言作为训练视觉识别模型的监督信号大有前景。近期工作表明,若在大型训练数据集中以图像与标题对齐的形式使用此类监督,则所得对齐模型在零样本分类等下游任务上表现良好。本文中,我们着力梳理语言监督中哪些部分对训练零样本图像分类模型至关重要。通过广泛而细致的实验,我们表明:1) 简单的词袋(BoW)标题可替代数据集中大部分图像标题。令人惊讶的是,我们观察到该方法在与词平衡结合时提升了零样本分类性能。2) 使用BoW预训练模型,我们可通过为无标题图像生成伪BoW标题来获取更多训练数据。在真实与伪BoW标题图像上训练的模型实现了更强的零样本性能。在ImageNet-1k零样本评估上,我们仅使用3M图像-标题对的最佳模型,性能与在15M图像-标题对上训练的CLIP模型相当(31.5% vs 31.3%)。

关键词

引用

@article{arxiv.2112.13884,
  title  = {A Fistful of Words: Learning Transferable Visual Models from Bag-of-Words Supervision},
  author = {Ajinkya Tejankar and Maziar Sanjabi and Bichen Wu and Saining Xie and Madian Khabsa and Hamed Pirsiavash and Hamed Firooz},
  journal= {arXiv preprint arXiv:2112.13884},
  year   = {2022}
}