中文

从自然语言监督中学习可迁移的视觉模型

计算机视觉与模式识别 2021-03-02 v1 机器学习

摘要

最先进的计算机视觉系统被训练用来预测一组固定的预定物体类别。这种受限的监督形式限制了它们的通用性和可用性,因为需要额外的标注数据来指定任何其他视觉概念。直接从关于图像的原始文本中学习是一种有前景的替代方案,它利用了更广泛的监督来源。我们证明,在从互联网收集的4亿个(图像,文本)对的数据集上,预测哪个标题与哪个图像相匹配这一简单的预训练任务,是一种高效且可扩展的从零开始学习SOTA图像表示的方法。预训练后,自然语言被用于指代学习到的视觉概念(或描述新概念),从而实现模型向下游任务的零样本迁移。我们通过在30多个不同的现有计算机视觉数据集上进行基准测试来研究该方法的性能,这些数据集涵盖OCR、视频中的动作识别、地理定位以及许多类型的细粒度物体分类等任务。该模型对非平凡地迁移到大多数任务,并且通常能与全监督基线相竞争,而无需任何特定数据集的训练。例如,我们在ImageNet上以零样本匹配了原始ResNet-50的准确率,且无需使用其训练所用的128万张训练样本中的任何一张。我们在 https://github.com/OpenAI/CLIP 发布了我们的代码和预训练模型权重。

关键词

引用

@article{arxiv.2103.00020,
  title  = {Learning Transferable Visual Models From Natural Language Supervision},
  author = {Alec Radford and Jong Wook Kim and Chris Hallacy and Aditya Ramesh and Gabriel Goh and Sandhini Agarwal and Girish Sastry and Amanda Askell and Pamela Mishkin and Jack Clark and Gretchen Krueger and Ilya Sutskever},
  journal= {arXiv preprint arXiv:2103.00020},
  year   = {2021}
}