用于零样本学习的视觉-语义图匹配网络
计算机视觉与模式识别
2024-11-19 v1
摘要
零样本学习 (zero-shot learning, ZSL) 旨在利用额外的语义信息来识别未见过的类别。为了将知识从已见类别迁移到未见类别,大多数 ZSL 方法通常通过简单地将视觉嵌入与语义原型对齐来学习一个共享的嵌入空间。然而,在这种范式下训练的方法往往难以学习到鲁棒的嵌入空间,因为它们在类别之间以孤立的方式对齐两种模态,忽略了对齐过程中关键的类别关系。为了解决上述挑战,本文提出了一种视觉-语义图匹配网络,称为 VSGMN,它利用类别间的语义关系来辅助视觉-语义嵌入。VSGMN 采用图构建网络 (Graph Build Network, GBN) 和图匹配网络 (Graph Matching Network, GMN) 来实现两阶段的视觉-语义对齐。具体来说,GBN 首先利用基于嵌入的方法在语义空间中构建视觉图和语义图,并将嵌入与其原型对齐,完成第一阶段对齐。此外,为了补充这些图中未见过的类别关系,GBN 还基于语义关系构建了未见过的类别节点。在第二阶段,GMN 持续将邻居信息和跨图信息整合到构建的图节点中,并在类别关系约束下对齐两个图之间的节点关系。在三个基准数据集上的大量实验表明,VSGMN 在传统和广义 ZSL 场景下均取得了优越的性能。我们的 VSGMN 实现和实验结果可在 github 上获取:https://github.com/dbwfd/VSGMN
引用
@article{arxiv.2411.11351,
title = {Visual-Semantic Graph Matching Net for Zero-Shot Learning},
author = {Bowen Duan and Shiming Chen and Yufei Guo and Guo-Sen Xie and Weiping Ding and Yisong Wang},
journal= {arXiv preprint arXiv:2411.11351},
year = {2024}
}
备注
15 pages, 6 figures