CWCL:基于连续加权对比损失的跨模态迁移
机器学习
2023-09-27 v1 人工智能
计算机视觉与模式识别
摘要
本文考虑用于跨模态零样本迁移的对比训练,其中某一模态的预训练模型利用成对数据在另一域中进行表示学习。后一域中学习到的模型随后可以零样本方式用于多种任务,类似于近期备受关注的“对比语言-图像预训练(CLIP)”和“锁定图像微调(LiT)”。大多数现有的跨模态表示对齐工作(包括 CLIP 和 LiT)使用标准对比训练目标,其采用正例和负例集合来对齐相似并排斥不相似的训练数据样本。然而,训练样本间的相似性具有更连续的性质,因此需要更“非二元”的处理。为此,我们提出一种称为连续加权对比损失(CWCL)的新损失函数,其采用连续相似性度量。通过 CWCL,我们旨在将一个模态的嵌入空间与另一模态对齐。由于所提损失函数中相似性的连续性,这些模型在多个模型、数据集和模态上的零样本迁移表现优于现有方法。特别地,我们考虑图像-文本与语音-文本模态对,我们的模型在零样本图像分类上比先前最优方法绝对提升 5-8%,在零样本语音到意图分类和关键词分类上绝对提升 20-30%。
引用
@article{arxiv.2309.14580,
title = {CWCL: Cross-Modal Transfer with Continuously Weighted Contrastive Loss},
author = {Rakshith Sharma Srinivasa and Jaejin Cho and Chouchang Yang and Yashas Malur Saidutta and Ching-Hua Lee and Yilin Shen and Hongxia Jin},
journal= {arXiv preprint arXiv:2309.14580},
year = {2023}
}
备注
Accepted to Neural Information Processing Systems (NeurIPS) 2023 conference