中文

显式高级概念在视觉到语言问题中有何价值?

计算机视觉与模式识别 2016-04-29 v6

摘要

近期视觉到语言(V2L)问题的许多进展是通过卷积神经网络(CNNs)与循环神经网络(RNNs)的结合实现的。该方法不显式表示高级语义概念,而是试图直接从图像特征推进至文本。我们在此提出一种将高级概念整合入极为成功的CNN-RNN方法中的方法,并表明其在图像描述与视觉问答的最先进性能上均取得显著改进。我们还展示同一机制可用于引入外部语义信息,且如此做可进一步提升性能。在此过程中,我们提供了关于高级语义信息在V2L问题中价值的分析。

关键词

引用

@article{arxiv.1506.01144,
  title  = {What value do explicit high level concepts have in vision to language problems?},
  author = {Qi Wu and Chunhua Shen and Lingqiao Liu and Anthony Dick and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1506.01144},
  year   = {2016}
}

备注

Accepted to IEEE Conf. Computer Vision and Pattern Recognition 2016. Fixed title