中文

随心而述:基于抽象场景图的细粒度图像描述生成控制

计算机视觉与模式识别 2020-03-03 v1 人工智能

摘要

人类能够根据需要以从粗到细的细节描述图像内容。然而,大多数图像描述生成模型是无意图感知的,无法主动根据不同的用户意图生成多样化描述。在这项工作中,我们提出抽象场景图(ASG)结构,以细粒度级别表示用户意图,并控制生成描述的内容与详细程度。ASG是一种有向图,由三种类型的抽象节点(对象、属性、关系)组成,这些节点在图像中接地,但不带任何具体语义标签。因此,它易于手动或自动获取。基于ASG,我们提出了一种新颖的ASG2Caption模型,能够识别图中的用户意图与语义,从而根据图结构生成所需描述。在VisualGenome和MSCOCO数据集上,我们的模型在基于ASG的条件控制能力上优于精心设计的基线。通过自动采样多样化ASG作为控制信号,它还显著提升了描述多样性。

关键词

引用

@article{arxiv.2003.00387,
  title  = {Say As You Wish: Fine-grained Control of Image Caption Generation with Abstract Scene Graphs},
  author = {Shizhe Chen and Qin Jin and Peng Wang and Qi Wu},
  journal= {arXiv preprint arXiv:2003.00387},
  year   = {2020}
}

备注

To be appeared in CVPR 2020