中文

CLAP:通过带增强提示的对比学习从风格中分离内容

计算机视觉与模式识别 2025-04-24 v6

摘要

对比视觉-语言模型(如CLIP)因所学特征卓越的泛化能力,在各种下游任务中备受关注。然而,它们学到的特征常混合内容与风格信息,这在一定程度上限制了其在分布偏移下的泛化能力。为克服此局限,我们采用多模态数据的因果生成视角,并提出带数据增强的对比学习,以从原始表示中解耦内容特征。为此,我们首先探索图像增强技术,并开发一种方法将其无缝集成到预训练的类似CLIP的模型中以提取纯内容特征。更进一步,认识到文本数据固有的语义丰富性与逻辑结构,我们探索使用文本增强将潜在内容从风格特征中分离。这使类似CLIP的模型编码器能专注于潜在内容信息,精炼预训练类似CLIP模型所学表示。我们在多个数据集上的大量实验表明,零样本和少样本分类任务取得显著提升,且对各种扰动的鲁棒性增强。这些结果凸显了我们所提方法在精炼视觉-语言表示和推进多模态学习最优水平方面的有效性。

关键词

引用

@article{arxiv.2311.16445,
  title  = {CLAP: Isolating Content from Style through Contrastive Learning with Augmented Prompts},
  author = {Yichao Cai and Yuhang Liu and Zhen Zhang and Javen Qinfeng Shi},
  journal= {arXiv preprint arXiv:2311.16445},
  year   = {2025}
}

备注

Accepted as a conference paper at ECCV 2024