面向生成式零样本学习的视觉增强动态语义原型
计算机视觉与模式识别
2024-04-24 v1
摘要
生成式零样本学习(ZSL)通过学习生成器为未见类合成视觉样本,这是推进 ZSL 的有效途径。然而,现有的生成方法依赖于高斯噪声和预定义语义原型的条件,这限制了生成器仅在特定已见类上进行优化,而非表征每个视觉实例,导致泛化能力差(例如,对已见类过拟合)。为了解决这个问题,我们提出了一种新颖的视觉增强动态语义原型方法(称为 VADS),通过将视觉增强知识充分融入语义条件,促进生成器学习准确的语义-视觉映射。具体而言,VADS 包含两个模块:(1)视觉感知领域知识学习模块(VDKL)学习视觉特征的局部偏差和全局先验(称为领域视觉知识),以此替代纯高斯噪声以提供更丰富的先验噪声信息;(2)面向视觉的语义更新模块(VOSU)根据样本的视觉表示更新语义原型。最终,我们将它们的输出拼接为动态语义原型,作为生成器的条件。大量实验表明,我们的 VADS 在三个著名数据集上取得了卓越的 CZSL 和 GZSL 性能,并在 SUN、CUB 和 AWA2 上分别以 6.4\%、5.9\% 和 4.2\% 的平均提升幅度优于其他 state-of-the-art 方法。
引用
@article{arxiv.2404.14808,
title = {Visual-Augmented Dynamic Semantic Prototype for Generative Zero-Shot Learning},
author = {Wenjin Hou and Shiming Chen and Shuhuang Chen and Ziming Hong and Yan Wang and Xuetao Feng and Salman Khan and Fahad Shahbaz Khan and Xinge You},
journal= {arXiv preprint arXiv:2404.14808},
year = {2024}
}