中文

以类人认知风格探索图像描述中的整体上下文信息

计算机视觉与模式识别 2019-10-16 v1

摘要

图像描述是一个研究热点,结合卷积神经网络(CNN)与长短期记忆网络(LSTM)的编码器-解码器模型取得了令人瞩目的结果。尽管取得了显著进展,这些模型生成句子的方式不同于人类认知风格。现有模型通常从第一个词到句末生成完整句子,而未考虑后续词对整个句子生成的影响。本文探索利用类人认知风格,即对待描述图像与待构建句子建立整体认知,以增强计算机图像理解。本文首先提出一种带双向LSTM的互辅网络结构(MaBi-LSTMs)以获取整体上下文信息。在训练过程中,前向与后向LSTM通过互补方式同时构建整个句子,将后续与前文词分别编码至各自的隐藏状态。在描述过程中,LSTM隐式利用其隐藏状态中包含的后续语义信息。事实上,MaBi-LSTMs可生成前向与后向两个方向的句子。为弥合跨域模型间的差距并生成更高质量的句子,我们进一步开发跨模态注意力机制,通过融合两个句子及其图像显著区域来润色句子。在Microsoft COCO数据集上的实验结果表明,所提模型提升了编码器-解码器模型的性能并取得了最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.1910.06475,
  title  = {Exploring Overall Contextual Information for Image Captioning in Human-Like Cognitive Style},
  author = {Hongwei Ge and Zehang Yan and Kai Zhang and Mingde Zhao and Liang Sun},
  journal= {arXiv preprint arXiv:1910.06475},
  year   = {2019}
}

备注

ICCV 2019