非对比学习遇见语言-图像预训练
计算机视觉与模式识别
2022-10-18 v1
摘要
对比语言-图像预训练 (CLIP) 是对齐图像与文本的事实标准。然而,网络爬取数据中图像与文本的松散关联使得对比目标数据效率低且渴求大训练批大小。本工作中,我们探索非对比语言-图像预训练 (nCLIP) 的有效性,并研究视觉自监督模型所展现的良好性质能否涌现。我们经实验观察到非对比目标滋养表征学习,但在零样本识别下表现明显不足。基于上述研究,我们进一步引入 xCLIP,一种结合 CLIP 与 nCLIP 的多任务框架,并表明 nCLIP 助益 CLIP 增强特征语义。两目标间的协同使 xCLIP 兼得二者之长:在零样本迁移与表征学习上均具优越表现。我们开展了涵盖零样本分类、域外分类、检索、视觉表征学习与文本表征学习等多种下游任务的系统评估,展示了稳定的性能提升并验证了 xCLIP 的有效性。
引用
@article{arxiv.2210.09304,
title = {Non-Contrastive Learning Meets Language-Image Pre-Training},
author = {Jinghao Zhou and Li Dong and Zhe Gan and Lijuan Wang and Furu Wei},
journal= {arXiv preprint arXiv:2210.09304},
year = {2022}
}