中文

ProtoCLIP:原型对比语言图像预训练

计算机视觉与模式识别 2023-11-22 v4

摘要

对比语言图像预训练(CLIP)已受到广泛关注,因为其学到的表征能够很好地迁移到各种下游任务。在 CLIP 模型的训练过程中,InfoNCE 目标对齐正样本图像-文本对并分离负样本对。我们展示了该过程中一种潜在的表征分组效应:InfoNCE 目标通过随机涌现的模态内锚点间接将语义相似的表征聚集在一起。基于这一理解,本文引入原型对比语言图像预训练(ProtoCLIP),通过提升其效率并增强其对模态间隙的鲁棒性来强化这种分组。具体而言,ProtoCLIP 在图像与文本空间之间建立原型级判别,高效地迁移更高层次的结构知识。进一步,提出原型反向翻译(PBT)将表征分组与表征对齐解耦,从而在大模态间隙下有效学习有意义的表征。PBT 还使我们能够引入具有更丰富先验语言知识的额外外部教师。ProtoCLIP 采用在线情景训练策略进行训练,使其可扩展到无限量的数据。我们在 Conceptual Captions 上训练 ProtoCLIP,取得了 +5.81% 的 ImageNet 线性探测提升和 +2.01% 的 ImageNet 零样本分类提升。在更大的 YFCC-15M 数据集上,ProtoCLIP 以 33% 的训练时间匹配了 CLIP 的性能。代码见 https://github.com/megvii-research/protoclip。

关键词

引用

@article{arxiv.2206.10996,
  title  = {ProtoCLIP: Prototypical Contrastive Language Image Pretraining},
  author = {Delong Chen and Zhao Wu and Fan Liu and Zaiquan Yang and Huaxi Huang and Ying Tan and Erjin Zhou},
  journal= {arXiv preprint arXiv:2206.10996},
  year   = {2023}
}

备注

Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS)