语义到空间 (S2S):将语义嵌入空间以进行零样本动宾查询推理
计算机视觉与模式识别
2019-09-17 v2
摘要
我们提出了一种新颖的深度零样本学习 (ZSL) 模型,用于对动宾 (VO) 查询进行人-物交互推理。虽然以往的双流 ZSL 方法仅使用语义/文本信息输入查询流,但我们寻求将语义也整合并嵌入到视觉表示流中。我们的方法由语义到空间 (S2S) 架构驱动,其中从存在的物体中导出的语义被嵌入到视觉流的空间中。该架构允许共同捕获人类和物体的语义属性及其位置/大小/轮廓信息。为了进行验证,我们构建了一个新数据集 Verb-Transferability 60 (VT60)。VT60 提供了 60 个具有重叠动词的不同 VO 对,专为测试带有 VO 查询的双流 ZSL 方法而设计。实验评估表明,我们的方法不仅优于现有技术 (SOTA),而且显示出无论使用哪种 ZSL 基线架构都能持续提升性能的能力。
引用
@article{arxiv.1906.05894,
title = {Semantics to Space(S2S): Embedding semantics into spatial space for zero-shot verb-object query inferencing},
author = {Sungmin Eum and Heesung Kwon},
journal= {arXiv preprint arXiv:1906.05894},
year = {2019}
}