中文

视觉语义嵌入中残留了什么

计算机视觉与模式识别 2021-07-27 v1

摘要

零样本学习(ZSL)在过去十年中因与幼儿识别新物体的机制紧密相关而受到广泛关注。尽管设计了不同范式的视觉语义嵌入模型来对齐视觉特征与分布式词表示,但目前尚不清楚现有 ZSL 模型在多大程度上编码了来自分布式词表示的语义信息。在本工作中,我们将 tiered-ImageNet 的划分引入 ZSL 任务,以避免标准 ImageNet 基准中的结构性缺陷。我们构建了一个以对比学习作为预训练的 ZSL 统一框架,该框架保证无语义信息泄漏并促使视觉特征线性可分。我们的工作使得在语义推理起决定性作用的 ZSL 设定下公平地评估视觉语义嵌入模型成为可能。借助该框架,我们表明当前 ZSL 模型难以编码来自词语类比和词语层级的语义关系。我们的分析为探索上下文语言表示在 ZSL 任务中的作用提供了动机。

关键词

引用

@article{arxiv.2107.11991,
  title  = {What Remains of Visual Semantic Embeddings},
  author = {Yue Jiao and Jonathon Hare and Adam Prügel-Bennett},
  journal= {arXiv preprint arXiv:2107.11991},
  year   = {2021}
}