中文

从图像文本描述推断空间关系

人工智能 2021-02-03 v1

摘要

从其文本描述生成图像既需要一定程度的语言理解,也需要关于所描述物理实体空间关系的常识知识。在本工作中,我们聚焦于推断实体间的空间关系,这是基于文本组合场景过程中的关键步骤。更具体地,给定包含对某一主体提及及其边界框位置与大小的标题,我们的目标是预测标题中所提及对象的位置与大小。先前工作未使用标题文本信息,而是使用手动提供的主体与对象间关系。事实上,所用评估数据集包含手动标注的本体三元组但无标题,使得该任务不切实际:需要手动步骤;且系统未利用标题中更丰富的信息。在此我们提出一个使用完整标题的系统,以及 Relations in Captions (REC-COCO),一个派生自 MS-COCO、可直接评估从标题推断空间关系的数据集。我们的实验表明:(1) 可直接从标题推断相对于给定主体的对象大小与位置;(2) 使用完整文本比使用手动标注关系能更好地放置对象。我们的工作为这类系统铺平了道路:给定标题,决定哪些实体需被描绘及其各自位置与大小,进而生成最终图像。

关键词

引用

@article{arxiv.2102.00997,
  title  = {Inferring spatial relations from textual descriptions of images},
  author = {Aitzol Elu and Gorka Azkune and Oier Lopez de Lacalle and Ignacio Arganda-Carreras and Aitor Soroa and Eneko Agirre},
  journal= {arXiv preprint arXiv:2102.00997},
  year   = {2021}
}

备注

Accepted in Pattern Recognition