中文

GBE-MLZSL:一种面向多标签零样本学习的分组双向增强框架

计算机视觉与模式识别 2023-09-15 v2 机器学习

摘要

本文研究多标签场景下的零样本学习(MLZSL)这一挑战性问题,其中模型基于可见类别和辅助知识(如语义信息)训练以识别样本(例如图像)中的多个未见类别。现有方法通常从空间或语义特征维度分析样本中各类可见类别间的关系,并将所学模型迁移至未见类别,但忽略了局部与全局特征的有效融合。即在推断未见类别时,全局特征代表图像在特征空间中的主方向,而局部特征应在一定范围内保持独特性。这种融合的缺失会使模型丧失对图像主要成分的把握。推理阶段仅依赖可见类别的局部存在会引入不可避免的偏差。本文提出一种新颖有效的MLZSL分组双向增强框架,称为GBE-MLZSL,以充分利用上述特性并实现更准确鲁棒的视觉-语义投影。具体而言,我们将特征图划分为若干特征组,每组可通过局部信息区分模块(LID)独立训练以保证独特性。同时,设计全局增强模块(GEM)以保留主方向。此外,设计静态图结构以构建局部特征间的关联。在大规模MLZSL基准数据集NUS-WIDE和Open-Images-v4上的实验表明,所提GBE-MLZSL以显著优势优于其他最先进(SOTA)方法。

关键词

引用

@article{arxiv.2309.00923,
  title  = {GBE-MLZSL: A Group Bi-Enhancement Framework for Multi-Label Zero-Shot Learning},
  author = {Ziming Liu and Jingcai Guo and Xiaocheng Lu and Song Guo and Peiran Dong and Jiewei Zhang},
  journal= {arXiv preprint arXiv:2309.00923},
  year   = {2023}
}

备注

11 pages, 8 figures