超越文字:通过扩散增强无监督提示学习中的判别丰富性
计算机视觉与模式识别
2025-04-17 v1
摘要
使用大量无标签数据对视觉-语言模型(VLMs)进行微调最近引起了广泛关注。然而,关键挑战仍在于缺乏高质量的伪标记数据。当前的伪标记策略常常在语义与视觉信息之间存在不匹配,导致无监督提示学习方法性能不佳。本文引入一种简单而有效的方法,称为通过扩散增强判别丰富性(AiR),以学习更丰富地代表类别的判别方式,从而促进分类。具体而言,我们的方法包括一个伪标签生成模块,该模块利用高保真合成样本创建辅助分类器,捕获更丰富的视觉变化,将文本-图像对分类扩展到更稳健的图像-图像对分类。此外,我们利用扩散基合成样本的多样性来增强提示学习,为语义-视觉对齐提供更多信息。在包括RESISC45和Flowers102在内的五个公开基准测试中,以及UL、SSL和TRZSL三个学习范式上,实验表明AiR在无监督提示学习方法方面实现了显著且持续的性能提升。
引用
@article{arxiv.2504.11930,
title = {Beyond Words: Augmenting Discriminative Richness via Diffusions in Unsupervised Prompt Learning},
author = {Hairui Ren and Fan Tang and He Zhao and Zixuan Wang and Dandan Guo and Yi Chang},
journal= {arXiv preprint arXiv:2504.11930},
year = {2025}
}