中文

视觉-语义嵌入空间的目标导向形变

计算机视觉与模式识别 2019-10-16 v1 多媒体

摘要

多模态嵌入是跨模态理解、数据挖掘与翻译的关键研究课题。许多研究试图从给定实体中提取表示并在共享嵌入空间中对齐它们。然而,由于不同模态中的实体表现出不同的抽象层次与模态特定信息,仅将相关实体嵌入得彼此接近是不够的。在本研究中,我们提出目标导向形变网络(TOD-Net),一种新颖的模块,其在给定条件下将嵌入空间连续形变为新空间,从而调整实体间的相似度。与基于跨模态注意力的方法不同,TOD-Net是一种应用于现有嵌入系统所学嵌入空间的后处理,并提升了它们的检索性能。特别地,当与前沿模型结合时,TOD-Net获得了关联MSCOCO数据集的最先进(state-of-the-art)跨模态检索模型。定性分析表明,TOD-Net成功强调了实体特定概念,并通过处理比现有模型更高层次的多样性来检索多样化目标。

关键词

引用

@article{arxiv.1910.06514,
  title  = {Target-Oriented Deformation of Visual-Semantic Embedding Space},
  author = {Takashi Matsubara},
  journal= {arXiv preprint arXiv:1910.06514},
  year   = {2019}
}

备注

8 pages