中文

IMAGINATOR:基于图像词级接地预训练的图像+文本联合嵌入

计算与语言 2023-05-19 v1 人工智能 计算机视觉与模式识别 多媒体

摘要

词嵌入,即语义上有意义的词向量表示,很大程度上受分布假说“观其伴而知其义”(Harris, 1954)的影响,而现代基于预测的神经网络嵌入则依赖于设计选择与超参数优化。Word2Vec、GloVe等词嵌入能很好地捕捉语境性与现实类比,但VGGNet、AlexNet等当代基于卷积的图像嵌入却不能捕捉上下文知识。流行的国王-王后类比在大多数常用视觉嵌入中并不成立。本文提出一种预训练联合嵌入(JE),名为IMAGINATOR,在来自100万图像+文本对的21K个不同图像对象层级上训练。JE是一种将多模态数据编码进向量空间的方法,其中文本模态作为接地键(grounding key),互补模态(此处为图像)据此锚定。IMAGINATOR封装了三种独立表示:(i)对象-对象共现,(ii)词-对象共现,以及(iii)词-对象关联。这三种方式捕捉了两模态的互补方面,并进一步组合以获得最终JE。生成的JE经过内在评估,以考察其捕捉语境性与现实类比的能力。我们还在三个下游任务上评估了预训练IMAGINATOR JE:(i)图像描述生成,(ii)Image2Tweet,以及(iii)基于文本的图像检索。IMAGINATOR在上述下游任务上确立了新标准,在所有选定任务上均优于当前SOTA。IMAGINATOR将公开可用。代码见 https://github.com/varunakk/IMAGINATOR

关键词

引用

@article{arxiv.2305.10438,
  title  = {IMAGINATOR: Pre-Trained Image+Text Joint Embeddings using Word-Level Grounding of Images},
  author = {Varuna Krishna and S Suryavardan and Shreyash Mishra and Sathyanarayanan Ramamoorthy and Parth Patwa and Megha Chakraborty and Aman Chadha and Amitava Das and Amit Sheth},
  journal= {arXiv preprint arXiv:2305.10438},
  year   = {2023}
}