真实场景下丰富的图像描述生成
计算机视觉与模式识别
2016-04-01 v2
摘要
我们提出了一个图像描述系统,以应对自动描述真实场景图像的新挑战。这些挑战包括相对于人类判断的高质量描述质量、域外数据处理,以及许多应用所需的低延迟。基于最先进的框架,我们开发了检测广泛视觉概念的深度视觉模型、识别名人和地标的实体识别模型,以及用于描述输出的置信度模型。实验结果表明,我们的描述引擎在域内数据集(即MS COCO)和域外数据集上均显著优于先前的最先进系统。
引用
@article{arxiv.1603.09016,
title = {Rich Image Captioning in the Wild},
author = {Kenneth Tran and Xiaodong He and Lei Zhang and Jian Sun and Cornelia Carapcea and Chris Thrasher and Chris Buehler and Chris Sienkiewicz},
journal= {arXiv preprint arXiv:1603.09016},
year = {2016}
}