中文

SYNC-CLIP:合成数据使 CLIP 在数据受限场景下实现更好泛化

计算机视觉与模式识别 2023-12-08 v1

摘要

提示学习是将 CLIP 等视觉语言模型迁移至下游任务的一项强大技术。然而,仅使用基类微调的基于提示的方法在开放词汇场景下可能难以泛化到新类,尤其是在数据受限的情况下。为了解决这一问题,我们提出了一种名为 SYNC-CLIP 的创新方法,该方法利用合成数据来增强 CLIP 的泛化能力。基于对真实样本与合成样本之间分布偏移的观察,我们将真实样本和合成样本视为不同的域,并提出优化独立的域提示以捕获特定域的信息,同时结合共享的视觉提示以保持两个域之间的语义一致性。通过对齐跨域特征,来自新类的合成数据可以为重新平衡决策边界提供隐式指导。在三个模型泛化任务上的实验结果表明,我们的方法在各种基准上均表现出极强的竞争力。值得注意的是,在开放词汇场景下的 11 个数据集中,SYNC-CLIP 在新类上的性能平均提升了 3.0%,优于当前最先进的竞争者 PromptSRC。

关键词

引用

@article{arxiv.2312.03805,
  title  = {SYNC-CLIP: Synthetic Data Make CLIP Generalize Better in Data-Limited Scenarios},
  author = {Mushui Liu and Weijie He and Ziqian Lu and Yunlong Yu},
  journal= {arXiv preprint arXiv:2312.03805},
  year   = {2023}
}

备注

Under Review