基于自蒸馏的数据高效语言监督零样本学习
计算机视觉与模式识别
2021-04-20 v1
摘要
传统计算机视觉模型被训练来预测一组固定的预定义类别。近来,自然语言已被证明是比有监督“金”标签提供更细粒度视觉概念描述的更宽泛更丰富的监督来源。先前工作如 CLIP 使用预测图像与文本描述配对这一简单预训练任务。然而,CLIP 数据需求量大,训练需要超过 4 亿图像-文本对。我们提出一种数据高效的对比蒸馏方法,利用软标签从含噪图像-文本对中学习。我们的模型从预训练的图像与句子编码器中迁移知识,仅用 3M 图像-文本对(比 CLIP 小 133 倍)即取得强劲性能。我们的方法以 ResNet50 图像编码器与 DeCLUTR 文本编码器在 ImageNet 21k+1k 上相对超越先前通用零样本学习 SOTA 达 73%。在 Google Open Images(19,958 类)的零样本评测上我们也相对击败 CLIP 达 10.5%。
引用
@article{arxiv.2104.08945,
title = {Data-Efficient Language-Supervised Zero-Shot Learning with Self-Distillation},
author = {Ruizhe Cheng and Bichen Wu and Peizhao Zhang and Peter Vajda and Joseph E. Gonzalez},
journal= {arXiv preprint arXiv:2104.08945},
year = {2021}
}
备注
4 pages, 1 figure