中文

用于多模态对齐的阶嵌入与字符级卷积

计算机视觉与模式识别 2022-11-11 v1

摘要

随着深度神经网络领域的最新快速进展,模式识别与计算机视觉领域的研究人员近期开始着手处理多项具有挑战性的基于图像的任务。在本文中,我们处理了其中一项任务,即将图像内容与自然语言描述进行匹配,有时也称为多模态内容检索。考虑到我们必须在标题与相应图像之间找到语义对应关系,这对计算机视觉和自然语言处理领域都是一项挑战,因此该任务尤为困难。为此,我们提出了一种仅基于卷积神经网络的新型多模态方法,通过对原始字符直接进行卷积来将图像与其标题对齐。我们提出的基于字符的文本嵌入允许替代词嵌入和循环神经网络来进行文本理解,从而节省了处理时间并需要更少的可学习参数。我们的方法基于将视觉和文本信息投影到一个共同嵌入空间的思想。为了训练此类嵌入,我们优化了一个对比损失函数,该函数被计算用于最小化图像及其相应描述之间的阶破坏。我们在最大且最著名的图像-文本对齐数据集(即 Microsoft COCO)上取得了 state-of-the-art 的性能,且该方法在概念上比现有方法简单得多,并具有相当少的参数。

关键词

引用

@article{arxiv.1706.00999,
  title  = {Order embeddings and character-level convolutions for multimodal alignment},
  author = {Jônatas Wehrmann and Anderson Mattjie and Rodrigo C. Barros},
  journal= {arXiv preprint arXiv:1706.00999},
  year   = {2022}
}

备注

7 pages, 5 figures, submitted to Pattern Recognition Letters