中文

PyramidCLIP:用于视觉-语言模型预训练的分层特征对齐

计算机视觉与模式识别 2022-05-31 v2 人工智能

摘要

大规模视觉-语言预训练在下游任务上取得了有前景的结果。现有方法高度依赖于从互联网爬取的图像-文本对具有完美一一对应关系的假设。然而,在实际场景中,这一假设难以成立:通过爬取图像附属元数据获得的文本描述常常存在语义不匹配与互斥兼容性问题。为解决这些问题,我们提出 PyramidCLIP,其为每种模态构建具有不同语义层次的输入金字塔,并通过同层语义对齐与跨层关系对齐的形式对齐视觉元素与语言元素。此外,我们软化负样本(未配对样本)的损失,以削弱预训练阶段的严格约束,从而缓解强制模型区分兼容负样本对的风险。在五个下游任务上的实验证明了所提 PyramidCLIP 的有效性。特别地,在相同的 1500 万预训练图像-文本对下,基于 ResNet50/ViT-B32/ViT-B16 图像编码器的 PyramidCLIP 在 ImageNet 零样本分类 top-1 准确率上分别超越 CLIP 达 10.6%/13.2%/10.0%。当扩展到更大数据集时,PyramidCLIP 在多个下游任务上取得最先进(SOTA)结果。特别地,在 1.43 亿图像-文本对上训练的 PyramidCLIP-ResNet50 在 ImageNet 零样本分类任务上的结果超过了使用 4 亿数据的 CLIP,显著提升了 CLIP 的数据效率。

关键词

引用

@article{arxiv.2204.14095,
  title  = {PyramidCLIP: Hierarchical Feature Alignment for Vision-language Model Pretraining},
  author = {Yuting Gao and Jinfeng Liu and Zihan Xu and Jun Zhang and Ke Li and Rongrong Ji and Chunhua Shen},
  journal= {arXiv preprint arXiv:2204.14095},
  year   = {2022}
}