中文

生成具有视觉定位与共同指代的人物描述

计算机视觉与模式识别 2017-04-06 v1

摘要

学习如何生成图像或视频的描述在计算机视觉和自然语言处理社区都受到了主要关注。虽然少数工作提出在生成过程中以无监督方式(通过注意力机制)学习 grounding,但 grounding 的质量如何以及它是否有利于描述质量仍不清楚。在本工作中,我们提出一个电影描述模型,该模型学习生成描述并联合定位(局部化)所提及的角色,以及在连续句子/片段对之间执行视觉共同指代消解。我们还提议利用电影描述中提供的角色提及作为弱定位监督来学习角色定位。在训练时,我们首先通过半监督方法将角色的视觉外观与描述中的提及相关联来学习如何定位角色。然后我们将此(有噪声的)监督输入我们的描述模型,这极大提升了其性能。我们提出的描述模型在生成描述质量上优于先前工作,并且额外提供定位和局部共同指代消解。我们在MPII电影描述数据集上使用自动和人工评估指标以及我们新收集的针对角色的定位和共同指代数据对其进行了评估。

关键词

引用

@article{arxiv.1704.01518,
  title  = {Generating Descriptions with Grounded and Co-Referenced People},
  author = {Anna Rohrbach and Marcus Rohrbach and Siyu Tang and Seong Joon Oh and Bernt Schiele},
  journal= {arXiv preprint arXiv:1704.01518},
  year   = {2017}
}

备注

Accepted to CVPR 2017