中文

用于零样本学习的渐进式语义引导视觉Transformer

高能物理 - 唯象学 2025-01-08 v2 宇宙学与河外天体物理 高能天体物理现象

摘要

零样本学习(ZSL)通过进行视觉-语义交互,将语义知识从可见类迁移到不可见类,从而识别不可见类,这需要语义信息(如属性)的支持。然而,现有的ZSL方法仅使用预训练的网络主干(即CNN或ViT)提取视觉特征,由于缺乏语义信息的引导,无法学习到匹配的视觉-语义对应关系来表示与语义相关的视觉特征,导致不理想的视觉-语义交互。针对此问题,我们提出了一种用于零样本学习的渐进式语义引导视觉Transformer(称为ZSLViT)。ZSLViT主要在网络中考虑两个特性:i)显式地发现与语义相关的视觉表示,ii)丢弃与语义无关的视觉信息。具体来说,我们首先引入语义嵌入令牌学习,通过语义增强来改善视觉-语义对应关系,并利用语义引导的令牌注意力显式地发现与语义相关的视觉令牌。然后,我们融合低语义对应度的视觉令牌,以丢弃与语义无关的视觉信息,从而实现视觉增强。这两个操作被集成到各种编码器中,以在ZSL中渐进地学习与语义相关的视觉表示,从而实现准确的视觉-语义交互。大量实验表明,我们的ZSLViT在三个流行的基准数据集(即CUB、SUN和AWA2)上取得了显著的性能提升。代码可在 https://github.com/shiming-chen/ZSLViT 获取。

关键词

引用

@article{arxiv.2404.07714,
  title  = {Self-Interacting Dark Sectors in Supernovae Can Behave as a Relativistic Fluid},
  author = {Damiano F. G. Fiorillo and Edoardo Vitagliano},
  journal= {arXiv preprint arXiv:2404.07714},
  year   = {2025}
}

备注

5 pages, 2 figures, with Supplemental Material; version published on PRL