ZeroMamba:探索用于零样本学习的视觉状态空间模型
计算机视觉与模式识别
2024-12-12 v1
摘要
零样本学习旨在通过从可见类向不可见类迁移语义知识,在语义信息的引导下识别不可见类。为此,现有工作通过利用卷积神经网络或视觉变换器的全局视觉特征进行视觉-语义交互,已展现出卓越的性能。然而,由于卷积神经网络的感受野有限以及视觉变换器的二次复杂度,这些视觉骨干网络实现了次优的视觉-语义交互。本文受能够捕获长程依赖关系并建模复杂视觉动态的视觉状态空间模型(即Vision Mamba)的启发,提出了一种参数高效的零样本学习框架ZeroMamba,以推动零样本学习的发展。我们的ZeroMamba包含三个关键组件:语义感知局部投影、全局表示学习和语义融合。具体而言,语义感知局部投影整合语义嵌入,将视觉特征映射到局部语义相关表示,而全局表示学习则鼓励模型学习全局语义表示。语义融合结合这两种语义表示以增强语义特征的判别性。我们将这些设计融入Vision Mamba,形成了一个端到端的零样本学习框架。因此,学习到的语义表示更适用于分类。通过在四个著名的零样本学习基准上进行的大量实验,ZeroMamba展现了优越的性能,在传统零样本学习和广义零样本学习设置下均显著优于最先进的方法(即基于卷积神经网络和基于视觉变换器的方法)。代码可在https://anonymous.4open.science/r/ZeroMamba获取。
引用
@article{arxiv.2408.14868,
title = {ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning},
author = {Wenjin Hou and Dingjie Fu and Kun Li and Shiming Chen and Hehe Fan and Yi Yang},
journal= {arXiv preprint arXiv:2408.14868},
year = {2024}
}