中文

联合提示适配器学习用于多标签图像识别的文本到图像方法

计算机视觉与模式识别 2025-06-13 v1

摘要

受益于图像-文本对比学习,预训练视觉-语言模型(如CLIP)允许直接利用文本作为图像(TaI)进行参数高效微调(PEFT)。虽然CLIP能够使图像特征与相应的文本特征相似,但模态鸿沟仍然是一个不可忽视的问题,限制了TaI的图像识别性能。以多标签图像识别(MLR)为例,我们提出了一种名为T2I-PAL的新型方法,用于解决仅使用文本标题进行PEFT时的模态鸿沟问题。T2I-PAL的核心设计是利用预训练的文本到图像生成模型从文本标题生成照片级真实且多样化的图像,从而缩小模态鸿沟。为进一步增强MLR,T2I-PAL结合了类别级热力图和可学习原型。这聚合了局部相似性,使局部视觉特征的表示对多标签识别更加鲁棒和具有信息量。为了更好地实现PEFT,我们进一步结合了提示调优和适配器学习以增强分类性能。T2I-PAL具有显著优势:它消除了对完全语义标注训练图像的需求,从而减少了人工标注工作量,并且保留了CLIP模型的固有模式,允许与任何现有CLIP框架无缝集成。在MS-COCO、VOC2007和NUS-WIDE等多个基准上的广泛实验表明,我们的T2I-PAL平均将识别性能提升了3.47%,超越了排名最高的最先进方法。

关键词

引用

@article{arxiv.2506.10575,
  title  = {Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning},
  author = {Chun-Mei Feng and Kai Yu and Xinxing Xu and Salman Khan and Rick Siow Mong Goh and Wangmeng Zuo and Yong Liu},
  journal= {arXiv preprint arXiv:2506.10575},
  year   = {2025}
}