$S^3$:用于提高视觉语言模型零样本泛化的同义语语义空间
计算机视觉与模式识别
2024-12-09 v1
摘要
最近,许多研究旨在通过解决下游任务中图像嵌入与文本嵌入之间的语义错位,来增强视觉语言模型(如 CLIP)的零样本泛化能力。尽管已有许多努力,但现有方法几乎不考虑图像类别可以因自然语言处理中已知的词汇差异而用显著不同文本概念描述的事实,这严重影响了 CLIP 的零样本泛化。因此,本文提出了每个图像类别的同义语义空间(),而非依赖单一文本概念,通过实现更稳定的语义对齐来提高 CLIP 的零样本泛化。具体而言,我们的 方法首先利用大语言模型生成每个类别的多个同义概念,并基于生成的同义概念的 Vietoris-Rips 复合构建连续且紧凑的同义语义空间。进一步,我们探讨了Several point-to-space metrics 对 的影响,同时提出了一种点到局部中心度量,用于计算图像嵌入与每个类别的同义语义空间之间的相似度,从而实现有效的零样本预测。在 17 项基准测试中进行了广泛实验,包括细粒度零样本分类、自然分布零样本分类和开放词汇分割,结果表明我们的 在状态的方法中取得了优异成绩。
引用
@article{arxiv.2412.04925,
title = {$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models},
author = {Xiaojie Yin and Qilong Wang and Bing Cao and Qinghua Hu},
journal= {arXiv preprint arXiv:2412.04925},
year = {2024}
}