中文

面向组合零样本学习的图嵌入学习

计算机视觉与模式识别 2021-05-05 v3

摘要

在组合零样本学习(compositional zero-shot learning)中,目标是识别训练集中已观测视觉基元状态(如 old、cute)与对象(如 car、dog)的未见过组合(如 old dog)。这是具有挑战性的,因为同一状态对狗和汽车视觉外观的改变可能截然不同。作为解决方案,我们提出了一种称为组合图嵌入(Compositional Graph Embedding, CGE)的新颖图形式,以端到端方式学习图像特征、组合分类器以及视觉基元的潜在表示。我们方法的关键在于利用状态、对象及其组合在图结构中的依赖关系,以强化从已见组合到未见组合的相关知识迁移。通过学习编码概念间语义的联合兼容性,我们的模型无需依赖如 WordNet 之类的外部知识库即可泛化至未见组合。我们表明,在具有挑战性的广义组合零样本设定下,我们的 CGE 在 MIT-States 与 UT-Zappos 上显著优于当前最优方法。我们还基于近期的 GQA 数据集提出了该任务的新基准。代码见:https://github.com/ExplainableML/czsl

关键词

引用

@article{arxiv.2102.01987,
  title  = {Learning Graph Embeddings for Compositional Zero-shot Learning},
  author = {Muhammad Ferjad Naeem and Yongqin Xian and Federico Tombari and Zeynep Akata},
  journal= {arXiv preprint arXiv:2102.01987},
  year   = {2021}
}

备注

Accepted in IEEE CVPR 2021