中文

PSVMA+: 探索广义零样本学习中的多粒度语义-视觉适应

计算机视觉与模式识别 2024-10-16 v1

摘要

广义零样本学习(GZSL)旨在使用来自已见领域的知识来识别未见类别,因而需要视觉特征与属性语义特征之间的内在交互。然而,GZSL因属性多样性和实例多样性导致视觉-语义对应关系不足。属性多样性指语义描述的粒度差异,从低层(具体、可直接观察)到高层(抽象、高度通用)特征。这种差异性在单一粒度下挑战了对属性提供充足视觉线索。此外,对应于相同共享属性的多样化视觉实例会引入语义歧义,导致模糊的视觉模式。为解决这些问题,我们提出了一种多粒度渐进式语义-视觉相互适应(PSVMA+)网络,PSVMA+可在不同粒度水平收集充足的视觉元素,以弥补粒度不一致。PSVMA+在视觉和语义元素中探索不同粒度水平的语义-视觉相互作用,实现对多粒度的感知。 在每个粒度水平上,双语义-视觉转换模块(DSVTM)将共享属性重新构建为以实例为中心的属性,并聚合与语义相关的视觉区域,从而学习明确的视觉特征以适应各种实例。鉴于不同粒度的不同贡献,PSVMA+采用选择性跨粒度学习,利用可靠的粒度并自适应融合多粒度特征以获得全面表征。实验结果表明,PSVMA+在各种方法上均表现出一致的优势。

关键词

引用

@article{arxiv.2410.11560,
  title  = {PSVMA+: Exploring Multi-granularity Semantic-visual Adaption for Generalized Zero-shot Learning},
  author = {Man Liu and Huihui Bai and Feng Li and Chunjie Zhang and Yunchao Wei and Meng Wang and Tat-Seng Chua and Yao Zhao},
  journal= {arXiv preprint arXiv:2410.11560},
  year   = {2024}
}

备注

Accepted to TPAMI 2024. arXiv admin note: text overlap with arXiv:2303.15322