面向零/少样本无训练视觉语言模型的高效且情境感知标签传播
计算机视觉与模式识别
2025-03-03 v2
摘要
视觉语言模型 (VLM) 通过利用大规模预训练模型来解决各种下游任务, revolutionized 机器学习领域。虽然标签、训练和数据效率有所提升,但许多最新的 VLM 仍需要任务特定的超参数调优,未能充分利用测试样本。为克服这些挑战,我们提出一种基于图的标签高效适应和推理方法。该方法动态构建文本提示、少量样本和测试样本之间的图结构,利用标签传播进行推理,无需任务特定调参。不同于现有的零样本标签传播技术, our 方法无需额外的无标签支持集,并通过动态图扩展有效地利用测试样本的流形结构。我们进一步引入情境感知特征加权机制以提高任务适应准确性。此外,本方法支持高效的图扩展,实现实时归纳推理。在细粒度分类和跨分布 generalizes 等下游任务上的大规模评估表明,我们方法的有效性。源码地址为 https://github.com/Yushu-Li/ECALP。
引用
@article{arxiv.2412.18303,
title = {Efficient and Context-Aware Label Propagation for Zero-/Few-Shot Training-Free Adaptation of Vision-Language Model},
author = {Yushu Li and Yongyi Su and Adam Goodge and Kui Jia and Xun Xu},
journal= {arXiv preprint arXiv:2412.18303},
year = {2025}
}