中文

基于Vision Transformer多头自注意力的零样本学习

计算机视觉与模式识别 2021-08-03 v1 机器学习

摘要

零样本学习(Zero-Shot Learning, ZSL)旨在识别训练阶段未观测到的未知物体类别。现有ZSL工作大多依赖预训练视觉特征,缺乏图像上显式的属性定位机制。本工作中,我们在ZSL问题设定下提出一种基于注意力的模型,以学习对未知类别识别有用的属性。我们的方法使用改编自Vision Transformer的注意力机制,通过将图像分割为小块来捕获并学习判别性属性。我们在三个流行的ZSL基准(AWA2、CUB和SUN)上进行了实验,并在所有三个数据集上取得了新的最先进调和均值结果,证明了所提方法的有效性。

关键词

引用

@article{arxiv.2108.00045,
  title  = {Multi-Head Self-Attention via Vision Transformer for Zero-Shot Learning},
  author = {Faisal Alamri and Anjan Dutta},
  journal= {arXiv preprint arXiv:2108.00045},
  year   = {2021}
}

备注

Irish Machine Vision and Image Processing Conference (IMVIP) 2021