中文

利用跨模态相似度匹配迁移预训练多模态表示

机器学习 2023-01-10 v1 计算机视觉与模式识别

摘要

尽管在零样本迁移上表现惊人,预训练大规模多模态模型往往令人望而却步,因为它需要海量数据和计算资源。在本文中,我们提出一种方法(BeamCLIP),能有效将大型预训练多模态模型(CLIP-ViT)的表示迁移到小型目标模型(如 ResNet-18)中。对于无监督迁移,我们引入跨模态相似度匹配(CSM),使学生模型通过匹配跨文本提示嵌入的相对相似度分布来学习教师模型的表示。为更好地编码文本提示,我们设计了基于上下文的提示增强(CPA),可缓解输入文本提示的词汇歧义。我们的实验表明,预训练视觉-语言模型的无监督表示迁移使小型 ResNet-18 在 ImageNet-1K 上取得比仅视觉自监督学习(SSL)方法(如 SimCLR: 51.8%、SwAV: 63.7%)更好的 top-1 线性探测准确率(66.2%),同时缩小了与有监督学习(69.8%)的差距。

关键词

引用

@article{arxiv.2301.02903,
  title  = {Transferring Pre-trained Multimodal Representations with Cross-modal Similarity Matching},
  author = {Byoungjip Kim and Sungik Choi and Dasol Hwang and Moontae Lee and Honglak Lee},
  journal= {arXiv preprint arXiv:2301.02903},
  year   = {2023}
}

备注

20 pages, 10 figures, NeurIPS 2022