中文

ALIP:基于合成描述的自适应语言-图像预训练

计算机视觉与模式识别 2023-08-21 v2

摘要

对比语言-图像预训练(CLIP)通过利用从网络收集的图像-文本对扩展数据集,显著提升了各种视觉-语言任务的性能。然而,网络数据中存在的内在噪声与不匹配的图像-文本对可能影响表征学习的效果。为解决此问题,我们首先利用OFA模型生成聚焦于图像内容的合成描述。所生成的描述包含对预训练有益的互补信息。然后,我们提出自适应语言-图像预训练(ALIP),一种整合来自原始文本与合成描述的监督的双路径模型。作为ALIP的核心组件,语言一致性门(LCG)与描述一致性门(DCG)在训练过程中动态调整样本以及图像-文本/描述对的权重。同时,自适应对比损失能有效降低噪声数据的影响并提升预训练数据的效率。我们在不同规模的模型与预训练数据集上通过实验验证ALIP。实验结果表明,ALIP在包括零样本图像-文本检索与线性探测在内的多个下游任务上达到最先进(state-of-the-art)性能。为便利未来研究,代码与预训练模型发布于 https://github.com/deepglint/ALIP。

关键词

引用

@article{arxiv.2308.08428,
  title  = {ALIP: Adaptive Language-Image Pre-training with Synthetic Caption},
  author = {Kaicheng Yang and Jiankang Deng and Xiang An and Jiawei Li and Ziyong Feng and Jia Guo and Jing Yang and Tongliang Liu},
  journal= {arXiv preprint arXiv:2308.08428},
  year   = {2023}
}

备注

15pages, 10figures, ICCV2023