生成、转导、适应:基于视觉语言模型的迭代转导
计算机视觉与模式识别
2025-10-15 v2
摘要
基于视觉语言模型的转导零样本学习利用数据集内的图像-图像相似性,相比归纳设置实现了更好的分类精度。然而,在此背景下探索语言空间结构的工作很少。我们提出GTA-CLIP,一种新颖的技术,它结合了来自语言模型的监督,用于语言和视觉空间中的联合转导。我们的方法是迭代的,包括三个步骤:(i) 通过查询语言模型逐步探索属性空间,(ii) 属性增强的转导推理过程,以及(iii) 基于数据集内推断出的标签对语言和视觉编码器进行微调。通过使用CLIP编码器的实验,我们证明GTA-CLIP在零样本设置下,在12个数据集和3个编码器上,相比CLIP和转导CLIP分别平均提高了8.6%和3.7%的性能。我们在少样本设置中也观察到类似的改进。我们进行了消融研究,展示了每个步骤的价值,并可视化了在转导学习驱动下视觉和语言空间随迭代的演变。代码发布在 https://github.com/cvl-umass/GTA-CLIP。
引用
@article{arxiv.2501.06031,
title = {Generate, Transduct, Adapt: Iterative Transduction with VLMs},
author = {Oindrila Saha and Logan Lawrence and Grant Van Horn and Subhransu Maji},
journal= {arXiv preprint arXiv:2501.06031},
year = {2025}
}
备注
Code is released at https://github.com/cvl-umass/GTA-CLIP