中文

DUET:面向对比式零样本学习的跨模态语义接地

计算机视觉与模式识别 2023-02-17 v4 人工智能

摘要

零样本学习(ZSL)旨在预测训练期间从未出现样本的非可见类别。用于零样本图像分类最有效且广泛使用的语义信息之一是属性,即类级视觉特征的标注。然而,当前方法常因细粒度标注匮乏以及属性不平衡与共生现象,难以区分图像间细微视觉差异。本文提出一种基于Transformer的端到端ZSL方法DUET,其通过自监督多模态学习范式整合来自预训练语言模型(PLMs)的潜在语义知识。具体而言,我们(1)开发了跨模态语义接地网络以探究模型从图像中解耦语义属性的能力;(2)应用属性级对比学习策略,针对属性共生与不平衡进一步增强模型对细粒度视觉特征的判别力;(3)提出多任务学习策略以兼顾多模型目标。我们发现DUET在三个标准ZSL基准及一个知识图谱增强的ZSL基准上均达到最先进性能。其各组件有效且预测可解释。

关键词

引用

@article{arxiv.2207.01328,
  title  = {DUET: Cross-modal Semantic Grounding for Contrastive Zero-shot Learning},
  author = {Zhuo Chen and Yufeng Huang and Jiaoyan Chen and Yuxia Geng and Wen Zhang and Yin Fang and Jeff Z. Pan and Huajun Chen},
  journal= {arXiv preprint arXiv:2207.01328},
  year   = {2023}
}

备注

AAAI 2023 (Oral). Repository: https://github.com/zjukg/DUET