中文

真实场景下丰富的图像描述生成

计算机视觉与模式识别 2016-04-01 v2

摘要

我们提出了一个图像描述系统,以应对自动描述真实场景图像的新挑战。这些挑战包括相对于人类判断的高质量描述质量、域外数据处理,以及许多应用所需的低延迟。基于最先进的框架,我们开发了检测广泛视觉概念的深度视觉模型、识别名人和地标的实体识别模型,以及用于描述输出的置信度模型。实验结果表明,我们的描述引擎在域内数据集(即MS COCO)和域外数据集上均显著优于先前的最先进系统。

关键词

引用

@article{arxiv.1603.09016,
  title  = {Rich Image Captioning in the Wild},
  author = {Kenneth Tran and Xiaodong He and Lei Zhang and Jian Sun and Cornelia Carapcea and Chris Thrasher and Chris Buehler and Chris Sienkiewicz},
  journal= {arXiv preprint arXiv:1603.09016},
  year   = {2016}
}