中文

SoftCLIP:更柔和的跨模态对齐使 CLIP 更强

计算机视觉与模式识别 2023-12-19 v2 人工智能

摘要

在前两年中,视觉—语言预训练在若干下游任务上取得了显著成功。然而,获取完全互斥的高质量图像—文本对仍是一项挑战,且常用数据集中存在噪声。为解决此问题,我们提出 SoftCLIP,一种通过引入由细粒度模态内自相似度生成的软化目标,放宽严格的一对一约束并实现柔和跨模态对齐的新方法。模态内引导有助于使两对具有某些局部相似性,并建模两模态间的多对多关系。此外,由于正样本在软化目标分布中仍占主导,我们将分布中的负样本解耦,以进一步在跨模态学习中增强与负样本的关系对齐。大量实验证明了 SoftCLIP 的有效性。特别是在 ImageNet 零样本分类任务上,使用 CC3M/CC12M 作为预训练数据集,SoftCLIP 相较 CLIP 基线带来了 6.8%/7.2% 的 top-1 准确率提升。

关键词

引用

@article{arxiv.2303.17561,
  title  = {SoftCLIP: Softer Cross-modal Alignment Makes CLIP Stronger},
  author = {Yuting Gao and Jinfeng Liu and Zihan Xu and Tong Wu Enwei Zhang and Wei Liu and Jie Yang and Ke Li and Xing Sun},
  journal= {arXiv preprint arXiv:2303.17561},
  year   = {2023}
}