中文

TransZero++:面向零样本学习的跨属性引导 Transformer

计算机视觉与模式识别 2022-12-14 v3 人工智能

摘要

零样本学习(ZSL)通过将语义知识从已见类迁移到未见类来解决新颖类别识别问题。现有的基于注意力的模型仅使用单向注意力,难以在单幅图像中学习劣质区域特征,忽略了视觉特征的可迁移性与判别性属性定位。本文提出一种跨属性引导 Transformer 网络,称为 TransZero++,用于精炼视觉特征并学习准确的属性定位,以得到 ZSL 中语义增强的视觉嵌入表示。TransZero++ 由一个属性\rightarrow视觉 Transformer 子网络(AVT)和一个视觉\rightarrow属性 Transformer 子网络(VAT)组成。具体而言,AVT 首先采用特征增强编码器来缓解跨数据集问题,并通过减少区域特征间纠缠的相对几何关系来提升视觉特征的可迁移性。随后,采用属性\rightarrow视觉解码器来定位给定图像中与各属性最相关的图像区域,以得到基于属性的视觉特征表示。类似地,VAT 使用相似的特征增强编码器来精炼视觉特征,并进一步用于视觉\rightarrow属性解码器以学习基于视觉的属性特征。通过进一步引入语义协同损失,两个属性引导的 Transformer 通过语义协同学习相互教导以学习语义增强的视觉嵌入。大量实验表明,TransZero++ 在三个具有挑战性的 ZSL 基准上取得了新的最先进(SOTA)结果。代码见:\url{https://github.com/shiming-chen/TransZero_pp}。

关键词

引用

@article{arxiv.2112.08643,
  title  = {TransZero++: Cross Attribute-Guided Transformer for Zero-Shot Learning},
  author = {Shiming Chen and Ziming Hong and Wenjin Hou and Guo-Sen Xie and Yibing Song and Jian Zhao and Xinge You and Shuicheng Yan and Ling Shao},
  journal= {arXiv preprint arXiv:2112.08643},
  year   = {2022}
}

备注

This is an extention of AAAI'22 paper (TransZero). Accepted to TPAMI. arXiv admin note: substantial text overlap with arXiv:2112.01683