TransZero:用于零样本学习的属性引导 Transformer
计算机视觉与模式识别
2021-12-06 v1 人工智能
摘要
零样本学习(ZSL)旨在通过将从已见类迁移的语义知识转移到未见类来识别新颖类别。语义知识从各类别间共享的属性描述中学习,这些描述充当定位代表判别性区域特征的物体属性的强先验,从而实现显著的视觉-语义交互。尽管一些基于注意力的模型已尝试在单幅图像中学习此类区域特征,但视觉特征的可迁移性和判别性属性定位通常被忽视。在本文中,我们提出一种称为 TransZero 的属性引导 Transformer 网络,以精炼视觉特征并学习 ZSL 中判别性视觉嵌入表示的属性定位。具体而言,TransZero 采用特征增强编码器缓解 ImageNet 与 ZSL 基准之间的跨数据集偏差,并通过减少区域特征间纠缠的相对几何关系来提升视觉特征的可迁移性。为学习局部增强的视觉特征,TransZero 在语义属性信息引导下,采用视觉-语义解码器定位给定图像中与各属性最相关的图像区域。随后,局部增强的视觉特征与语义向量被用于在一个视觉-语义嵌入网络中进行有效的视觉-语义交互。大量实验表明,TransZero 在三个 ZSL 基准上达到了新的 SOTA。代码见:\url{https://github.com/shiming-chen/TransZero}。
引用
@article{arxiv.2112.01683,
title = {TransZero: Attribute-guided Transformer for Zero-Shot Learning},
author = {Shiming Chen and Ziming Hong and Yang Liu and Guo-Sen Xie and Baigui Sun and Hao Li and Qinmu Peng and Ke Lu and Xinge You},
journal= {arXiv preprint arXiv:2112.01683},
year = {2021}
}
备注
Accepted to AAAI'22