中文

通过多样性驱动的新颖特征合成提升视觉语言模型的泛化能力

计算机视觉与模式识别 2024-08-14 v2

摘要

视觉语言基础模型如 CLIP 已显示出惊人的零样本泛化能力,但在下游数据集上进行微调可能导致过拟合并损失其对未见域的泛化能力。虽然收集来自新兴兴趣域的额外数据是可能的,但由于获取标注数据的困难,这种方法往往难以实现。为此,我们提出一种称为 LDFS(Language-Guided Diverse Feature Synthesis,语言引导的多样化特征合成)的即插即用特征合成方法,用于合成新域特征并改进现有 CLIP 微调策略。LDFS 有三个主要贡献:1)为合成新域特征并促进多样性,我们提出了基于文本引导特征增强损失的实例条件特征增强策略。2)为维持增强后特征的质量,我们引入了两两正则化器以保留 CLIP 特征空间中增强特征的一致性。3)我们提出使用随机文本特征增强来减少模态差距并进一步促进文本引导的特征合成过程。大量实验表明,LDFS 在不收集这些域数据的情况下,显著提升了 CLIP 在未见域上的泛化能力。代码将公开提供。

关键词

引用

@article{arxiv.2405.02586,
  title  = {Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis},
  author = {Siyuan Yan and Cheng Luo and Zhen Yu and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2405.02586},
  year   = {2024}
}