中文

文本与图像融合:判定 Instagram 帖子中的多模态文档意图

计算机视觉与模式识别 2019-11-11 v3

摘要

从 Instagram 帖子等多模态数据计算作者意图需要对文本与图像之间的复杂关系进行建模。例如,一条配文可能与图像形成讽刺性反差,因此配文与图像均非彼此的简单转录。相反,它们通过所谓的意义乘法相结合,创造出一种与文本和图像字面意义关系更为复杂的新意义。在此我们引入一个包含 1299 条 Instagram 帖子的多模态数据集,标注了三个正交分类体系:图像-配文对背后的作者意图、图像与配文字面意义之间的上下文关系,以及图像与配文所指意义之间的符号学关系。我们构建了一个基线深度多模态分类器来验证该分类体系,表明同时使用文本与图像相比仅使用图像模态将意图检测提升了 9.6%,展示了非交集意义乘法的普遍性。当图像与配文在符号学上偏离时,多模态带来的增益最大。我们的数据集为研究文本与图像配对所产生的丰富意义提供了新资源。

关键词

引用

@article{arxiv.1904.09073,
  title  = {Integrating Text and Image: Determining Multimodal Document Intent in Instagram Posts},
  author = {Julia Kruk and Jonah Lubin and Karan Sikka and Xiao Lin and Dan Jurafsky and Ajay Divakaran},
  journal= {arXiv preprint arXiv:1904.09073},
  year   = {2019}
}

备注

Accepted at EMNLP'2019; Added dataset link