中文

CLIP 中可迁移表示学习与零样本迁移的理解

机器学习 2024-07-12 v2 人工智能 机器学习

摘要

多模态学习因能够利用来自不同数据源(如文本和图像)的信息来提升模型性能而日益流行。近来,CLIP 作为一种有效的方法崭露头角,它采用视觉-语言对比预训练来学习联合图像与文本表示,并在零样本学习和文本引导的自然图像生成中展现出卓越性能。尽管 CLIP 取得了巨大的实际应用成功,其理论理解仍不明晰。在本文中,我们正式研究 CLIP 背后的可迁移表示学习,并阐明不同模态的特征如何对齐。我们还分析了其在下游任务上的零样本迁移性能。受我们的分析启发,我们提出了一种新的 CLIP 型方法,在基准数据集上取得了优于 CLIP 及其他最先进方法的性能。

关键词

引用

@article{arxiv.2310.00927,
  title  = {Understanding Transferable Representation Learning and Zero-shot Transfer in CLIP},
  author = {Zixiang Chen and Yihe Deng and Yuanzhi Li and Quanquan Gu},
  journal= {arXiv preprint arXiv:2310.00927},
  year   = {2024}
}

备注

31 pages, 7 tables, 6 figures. In ICLR 2024