基于视觉Transformer的特征提取用于广义零样本学习
计算机视觉与模式识别
2023-02-03 v1
摘要
广义零样本学习(GZSL)是一种利用图像属性训练深度学习模型以识别未见类别的技术。本文提出一种利用视觉Transformer(ViT)的新的 GZSL 方法,以最大化图像特征中所包含的与属性相关的信息。在 ViT 中,整个图像区域被处理而不降低图像分辨率,且局部图像信息保留在块特征中。为充分利用 ViT 的这些优势,我们在提取与属性相关的图像特征时同时利用块特征与 CLS 特征。特别地,我们提出一种称为属性注意力模块(AAM)的新型基于注意力的模块,以聚合块特征中与属性相关的信息。在 AAM 中,每个块特征与合成图像属性之间的相关性被用作各块的重要性权重。在基准数据集上的大量实验表明,所提技术大幅优于最先进的 GZSL 方法。
引用
@article{arxiv.2302.00875,
title = {Vision Transformer-based Feature Extraction for Generalized Zero-Shot Learning},
author = {Jiseob Kim and Kyuhong Shim and Junhan Kim and Byonghyo Shim},
journal= {arXiv preprint arXiv:2302.00875},
year = {2023}
}
备注
21 pages, 10 figures