面向广义零样本学习的视觉与语义提示协同
计算机视觉与模式识别
2025-04-01 v1
摘要
广义零样本学习旨在借助不同类别间共享的语义信息,识别已见类与未见类。这不可避免地需要一致的视觉-语义对齐。现有方法通过已见类数据微调视觉骨干网络以获取语义相关的视觉特征,这在训练图像数量有限的情况下可能导致对已见类的过拟合。本文提出了一种新颖的视觉与语义提示协同框架,利用提示微调技术实现高效的特征适应。具体而言,我们设计了一个视觉提示来整合视觉信息以进行判别性特征学习,并设计了一个语义提示来整合语义信息以进行视觉-语义对齐。为了实现有效的提示信息整合,我们在网络的浅层进一步设计了弱提示融合机制,在深层设计了强提示融合机制。通过视觉与语义提示的协同,我们能够获取用于广义零样本图像识别的判别性语义相关特征。大量实验表明,与其他SOTA方法相比,本框架在传统零样本学习与广义零样本学习基准上均持续取得了良好的性能。
引用
@article{arxiv.2503.23030,
title = {Visual and Semantic Prompt Collaboration for Generalized Zero-Shot Learning},
author = {Huajie Jiang and Zhengxian Li and Xiaohan Yu and Yongli Hu and Baocai Yin and Jian Yang and Yuankai Qi},
journal= {arXiv preprint arXiv:2503.23030},
year = {2025}
}
备注
Accepted by CVPR2025