中文

CapS-Adapter:零样本分类中基于标题的多模态适配器

计算机视觉与模式识别 2024-11-08 v2

摘要

近期视觉-语言基础模型(如CLIP)的进展在零样本分类方面展现了显著进步。然而,像CLIP这样的模型参数规模庞大,需要资源密集型的微调过程。为此,TIP-Adapter和SuS-X引入了免训练方法,旨在增强下游任务的效能。虽然这些方法采用支持集来保持知识缓存与测试集之间的数据分布一致性,但它们在测试集上的泛化能力往往不足,尤其是在面对具有显著分布变化的测试数据时。在这项工作中,我们提出了CapS-Adapter,一种创新方法,它采用基于标题的支持集,有效利用图像和标题特征,在免训练场景中超越了现有最先进技术。CapS-Adapter巧妙地构建了紧密反映目标分布的支持集,利用了从多模态大模型中提取的实例级分布特征。通过利用CLIP的单模态和跨模态优势,CapS-Adapter通过使用多模态支持集提高了预测准确性。我们的方法在19个基准数据集上取得了出色的零样本分类结果,准确率比先前领先方法提高了2.19%。我们的贡献通过在多个基准数据集上的广泛验证得到证实,展示了优越的性能和强大的泛化能力。我们的代码已在https://github.com/WLuLi/CapS-Adapter公开。

关键词

引用

@article{arxiv.2405.16591,
  title  = {CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification},
  author = {Qijie Wang and Guandu Liu and Bin Wang},
  journal= {arXiv preprint arXiv:2405.16591},
  year   = {2024}
}

备注

ACM Multimedia 2024 Poster