SPARC:面向视觉-语言模型零样本多标签识别的分数提示与自适应融合
计算机视觉与模式识别
2025-02-25 v1
摘要
在缺乏训练数据、模型微调或架构修改的情况下,使用视觉-语言模型 (VLM) 进行零样本多标签识别 (MLR) 面临重大挑战。现有方法需要提示微调或架构适配,限制了零样本适用性。本文提出了一种新颖的解决方案,将 VLM 视为黑盒,在不使用训练数据或真实标签的情况下利用分数。利用大语言模型关于物体共现的洞察,我们引入了基于现实物体组合的复合提示。对这些提示分数的分析揭示了 VLM 的偏差以及“AND”/“OR”信号的歧义,特别是发现最大复合分数令人惊讶地不如次高分数最优。我们通过去偏和分数融合算法解决了这些问题,该算法纠正了图像偏差并澄清了 VLM 的响应行为。我们的方法增强了其他零样本方法,持续改进了其结果。实验表明,与需要训练数据的方法相比,通过精细化的物体排序实现稳健的零样本 MLR,获得了更优的平均精度均值 (mAP)。
引用
@article{arxiv.2502.16911,
title = {SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models},
author = {Kevin Miller and Samarth Mishra and Aditya Gangrade and Kate Saenko and Venkatesh Saligrama},
journal= {arXiv preprint arXiv:2502.16911},
year = {2025}
}