中文

基于自蒸馏的数据高效语言监督零样本学习

计算机视觉与模式识别 2021-04-20 v1

摘要

传统计算机视觉模型被训练来预测一组固定的预定义类别。近来,自然语言已被证明是比有监督“金”标签提供更细粒度视觉概念描述的更宽泛更丰富的监督来源。先前工作如 CLIP 使用预测图像与文本描述配对这一简单预训练任务。然而,CLIP 数据需求量大,训练需要超过 4 亿图像-文本对。我们提出一种数据高效的对比蒸馏方法,利用软标签从含噪图像-文本对中学习。我们的模型从预训练的图像与句子编码器中迁移知识,仅用 3M 图像-文本对(比 CLIP 小 133 倍)即取得强劲性能。我们的方法以 ResNet50 图像编码器与 DeCLUTR 文本编码器在 ImageNet 21k+1k 上相对超越先前通用零样本学习 SOTA 达 73%。在 Google Open Images(19,958 类)的零样本评测上我们也相对击败 CLIP 达 10.5%。

关键词

引用

@article{arxiv.2104.08945,
  title  = {Data-Efficient Language-Supervised Zero-Shot Learning with Self-Distillation},
  author = {Ruizhe Cheng and Bichen Wu and Peizhao Zhang and Peter Vajda and Joseph E. Gonzalez},
  journal= {arXiv preprint arXiv:2104.08945},
  year   = {2021}
}

备注

4 pages, 1 figure