通过人类类概念引导提升视觉语言模型的零样本图像识别
计算机视觉与模式识别
2025-03-24 v2 机器学习
摘要
在零样本图像识别任务中,人类能够通过组合已知的简单概念来灵活地对未见类别进行分类。然而,现有的视觉语言模型(VLMs)尽管通过大规模自然语言监督取得了显著进展,却在实际应用中因提示工程不佳和难以有效适应目标类别而表现不佳。为此,我们提出了概念引导的人类类贝叶斯推理(CHBR)框架。基于贝叶斯定理,CHBR将人类图像识别中使用的概念建模为潜在变量,并通过加权先验分布和似然函数对潜在概念求和来构建该任务。为解决在无限概念空间上的不可计算问题,我们引入了重要抽样算法,通过持续提示大型语言模型(LLM)生成判别性概念,强调类别间差异。我们进一步提出了三种启发式方法,涉及平均似然、置信度似然以及测试时增强(TTA)似然,这些方法根据测试图像动态细化概念的组合。广泛的评估表明,CHBR在十五个数据集上 consistently 优于现有的领先零样本泛化方法。
引用
@article{arxiv.2503.15886,
title = {Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance},
author = {Hui Liu and Wenya Wang and Kecheng Chen and Jie Liu and Yibing Liu and Tiexin Qin and Peisong He and Xinghao Jiang and Haoliang Li},
journal= {arXiv preprint arXiv:2503.15886},
year = {2025}
}
备注
21 pages, 7 figures 7 tables