中文

PromptSync:通过类别感知原型对齐与判别弥合视觉-语言模型中的领域差距

计算机视觉与模式识别 2024-04-15 v2 计算与语言

摘要

视觉-语言(V-L)模型(如CLIP)的零样本泛化潜力已推动其广泛应用于解决众多下游任务。先前的方法采用测试时提示调优来使模型适应未见过的领域,但它们忽略了类别分布不平衡的问题。在本研究中,我们通过采用类别感知原型对齐(使用测试样本的平均类别概率和过滤后的增强视图进行加权)来明确解决这个问题。此外,我们通过使用对比学习进行原型判别,确保类别概率尽可能准确。对齐损失和判别损失的组合作为一个几何正则化器,防止提示表示坍缩到单个类别,并有效地弥合源域和测试域之间的分布差距。我们的方法名为PromptSync,它在V-L模型的文本分支和视觉分支上同步为每个测试样本调整提示。在领域泛化基准的实证评估中,我们的方法在整体性能上比之前的最佳方法高出2.33%,在基类到新类泛化上高出1%,在跨数据集迁移任务上高出2.84%。

关键词

引用

@article{arxiv.2404.07520,
  title  = {PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination},
  author = {Anant Khandelwal},
  journal= {arXiv preprint arXiv:2404.07520},
  year   = {2024}
}

备注

Accepted at CVPR 2024 LIMIT, 12 pages, 8 Tables, 2 Figures