中文

基于模态共享对比语言-图像预训练的视觉表征学习

计算机视觉与模式识别 2022-07-27 v1 计算与语言

摘要

大规模多模态对比预训练已展现出强大效用,通过将多种模态映射至共享嵌入空间,为一系列下游任务学习可迁移特征。典型做法是每种模态使用独立的编码器。然而,近期研究表明Transformer可支持跨模态学习并允许知识共享。受此启发,我们研究多种模态共享对比语言-图像预训练(MS-CLIP)框架。更具体地,我们探究在对比预训练期间Transformer模型有多少参数可跨模态共享,并严格考察将共享参数比例置于连续谱上的架构设计选择。在所研究条件下,我们观察到视觉与语言信号几乎统一的编码器优于所有分离更多参数的其他变体。此外,我们发现轻量级模态特定并行模块可进一步提升性能。实验结果表明,所提MS-CLIP方法在零样本ImageNet分类(在YFCC-100M上预训练)上相对原始CLIP最高提升13%,同时支持参数削减。此外,我们的方法在24个下游视觉任务的线性探测上以1.6分优于原始CLIP。进一步,我们发现参数共享使不同模态的语义概念在嵌入空间中编码得更接近,促进了通用语义结构(如注意力模式)从语言向视觉的迁移。代码见 \href{https://github.com/Hxyou/MSCLIP}{URL}。

关键词

引用

@article{arxiv.2207.12661,
  title  = {Learning Visual Representation from Modality-Shared Contrastive Language-Image Pre-training},
  author = {Haoxuan You and Luowei Zhou and Bin Xiao and Noel Codella and Yu Cheng and Ruochen Xu and Shih-Fu Chang and Lu Yuan},
  journal= {arXiv preprint arXiv:2207.12661},
  year   = {2022}
}

备注

Accepted by ECCV 2022, 22 pages, 4 figures