显式高级概念在视觉到语言问题中有何价值?
计算机视觉与模式识别
2016-04-29 v6
摘要
近期视觉到语言(V2L)问题的许多进展是通过卷积神经网络(CNNs)与循环神经网络(RNNs)的结合实现的。该方法不显式表示高级语义概念,而是试图直接从图像特征推进至文本。我们在此提出一种将高级概念整合入极为成功的CNN-RNN方法中的方法,并表明其在图像描述与视觉问答的最先进性能上均取得显著改进。我们还展示同一机制可用于引入外部语义信息,且如此做可进一步提升性能。在此过程中,我们提供了关于高级语义信息在V2L问题中价值的分析。
引用
@article{arxiv.1506.01144,
title = {What value do explicit high level concepts have in vision to language problems?},
author = {Qi Wu and Chunhua Shen and Lingqiao Liu and Anthony Dick and Anton van den Hengel},
journal= {arXiv preprint arXiv:1506.01144},
year = {2016}
}
备注
Accepted to IEEE Conf. Computer Vision and Pattern Recognition 2016. Fixed title