中文

Attend and Enrich:用于零样本学习的增强视觉提示

计算机视觉与模式识别 2025-03-11 v3

摘要

零样本学习 (ZSL) 旨在将见类别的知识迁移到识别未见类别,主要依赖于图像和属性标记之间的语义-视觉相互作用。最近,基于提示学习的方法在 ZSL 中涌现并显示出显著的潜力,因为它们允许将多样化的视觉概念零样本迁移到下游任务。然而,现有方法探索的都是在见域上固定适应的可学习提示,这会导致过度强调训练期间观察到的主要视觉特征,限制其对未见域的泛化能力。本文提出了 AENet,为视觉提示注入语义信息,以提炼语义增强提示用于视觉表征丰富,从而实现有效的知识迁移。AENet 包含两个关键步骤:1) 基于代表一致视觉-语义概念的模态共享标记,探索概念和谐化的视觉和属性模态的令牌;2) 通过视觉残差细化单元配合属性一致性监督,生成语义增强提示。进一步与主要视觉特征集成,以 attend 到语义相关信息用于视觉增强,从而强化可迁移能力。在三个基准测试上进行的实验结果表明,AENet 的性能优于现有的零样本学习方法。代码已提供于补充材料的 zip 文件中。

关键词

引用

@article{arxiv.2406.03032,
  title  = {Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning},
  author = {Man Liu and Huihui Bai and Feng Li and Chunjie Zhang and Yunchao Wei and Tat-Seng Chua and Yao Zhao},
  journal= {arXiv preprint arXiv:2406.03032},
  year   = {2025}
}

备注

Accepted by AAAI 2025