基于图的视觉-语义纠缠网络用于零样本图像识别
计算机视觉与模式识别
2022-01-07 v2 机器学习
图像与视频处理
摘要
零样本学习利用语义属性连接未见对象的搜索空间。近年来,尽管深度卷积网络为 ZSL 任务带来了强大的视觉建模能力,但其视觉特征存在严重的模式惯性与语义关系表征缺失,导致严重的偏差与歧义。对此,我们提出基于图的视觉-语义纠缠网络,对视觉特征进行图建模,并利用知识图将其映射到语义属性,其包含若干新颖设计:1. 建立卷积神经网络(CNN)与图卷积网络(GCN)的多路径纠缠网络,将 CNN 的视觉特征输入 GCN 以建模隐式语义关系,随后 GCN 将图建模信息反馈至 CNN 特征;2. 使用属性词向量作为 GCN 图语义建模的目标,形成图建模的自洽回归并监督 GCN 学习更具个性化的属性关系;3. 将图建模精炼的层次化视觉-语义特征融合补充至视觉嵌入中。我们的方法在多个代表性 ZSL 数据集 AwA2、CUB 和 SUN 上通过促进视觉特征的语义关联建模优于当前最优方法。
引用
@article{arxiv.2006.04648,
title = {Graph-based Visual-Semantic Entanglement Network for Zero-shot Image Recognition},
author = {Yang Hu and Guihua Wen and Adriane Chapman and Pei Yang and Mingnan Luo and Yingxue Xu and Dan Dai and Wendy Hall},
journal= {arXiv preprint arXiv:2006.04648},
year = {2022}
}
备注
15 pages, 11 figures, on IEEE Transactions on Multimedia