用于零样本学习的混合路由Transformer
计算机视觉与模式识别
2022-03-30 v1
摘要
零样本学习(ZSL)旨在基于具有已知语义数据的训练来学习能够识别未知图像语义的模型。近期研究或利用全局图像特征,或挖掘判别性局部块特征,以将提取的视觉特征关联到语义属性。然而,由于缺乏确保模型关注真实属性相关区域的必要自顶向下引导与语义对齐,这些方法仍遭遇视觉模态与属性模态间的显著语义鸿沟,使其对未知语义的预测不可靠。为解决该问题,本文建立了一种新颖的Transformer编码器-解码器模型,称为混合路由Transformer(HRT)。在HRT编码器中,我们嵌入了一种主动注意力,其由自底向上与自顶向下动态路由通路共同构建,以生成属性对齐的视觉特征。而在HRT解码器中,我们使用静态路由计算属性对齐视觉特征、对应属性语义与类属性向量间的关联,生成最终的类标签预测。该设计使所提Transformer模型成为以下两者的混合:1)自顶向下与自底向上注意力通路,以及2)动态与静态路由通路。在三个广泛使用的基准数据集CUB、SUN和AWA2上进行了综合实验。所得实验结果证明了所提方法的有效性。
引用
@article{arxiv.2203.15310,
title = {Hybrid Routing Transformer for Zero-Shot Learning},
author = {De Cheng and Gerong Wang and Bo Wang and Qiang Zhang and Jungong Han and Dingwen Zhang},
journal= {arXiv preprint arXiv:2203.15310},
year = {2022}
}