中文

用于组合零样本学习的分解软提示引导融合增强

计算机视觉与模式识别 2022-11-22 v1 人工智能

摘要

组合零样本学习(Compositional Zero-Shot Learning, CZSL)旨在识别由训练时已知的状态与对象所组成的新概念。现有方法要么学习状态-对象的组合表示,给未见过组合的泛化带来挑战,要么设计两个分类器从图像特征中分别识别状态与对象,忽略了它们之间的内在关联。为共同消除上述问题并构建更鲁棒的CZSL系统,我们提出一种称为分解软提示融合(Decomposed Fusion with Soft Prompt, DFSP)的新框架,通过引入视觉-语言模型(VLMs)用于未见过组合的识别。具体而言,DFSP构建可学习软提示与状态及对象的向量组合,以建立它们的联合表示。此外,在语言与图像分支间设计了跨模态分解融合模块,该模块在语言特征而非图像特征中分解状态与对象。值得注意的是,与分解特征融合后,图像特征能更具表现力地分别学习与状态及对象的关系,从而提升在配对空间中未见过组合的响应,进而缩小已见与未见集合间的域间隙。在三个具挑战性基准上的实验结果表明,我们的方法以较大优势显著优于其他最先进的方法。

关键词

引用

@article{arxiv.2211.10681,
  title  = {Decomposed Soft Prompt Guided Fusion Enhancing for Compositional Zero-Shot Learning},
  author = {Xiaocheng Lu and Ziming Liu and Song Guo and Jingcai Guo},
  journal= {arXiv preprint arXiv:2211.10681},
  year   = {2022}
}

备注

10 pages included reference, conference