中文

自引导多模态LSTM——当图像描述没有完美训练数据集时

计算机视觉与模式识别 2017-09-18 v1 计算与语言 机器学习

摘要

本文提出一种自引导多模态LSTM(sg-LSTM)图像描述模型,用于处理不受控的不平衡真实世界图像-句子数据集。我们从Flickr收集FlickrNYC数据集作为测试平台,包含306,165张图像,用户上传的原始文本描述被用作训练的真值。FlickrNYC数据集中的描述差异巨大,从短术语描述到长段落描述不等,且可描述任意视觉方面,甚至提及未描绘的对象。为应对不平衡和噪声情况并充分挖掘数据集本身,我们提出一种利用多模态LSTM(m-LSTM)模型提取的新颖引导文本特征。m-LSTM的训练基于图像内容与对应描述紧密关联的那部分数据。随后,在sg-LSTM于其余训练数据上训练时,该引导信息作为额外输入与图像表示和真值描述一并送入网络。通过将这些输入组件集成到一个多模态块中,我们旨在形成文本信息与图像内容紧密耦合的训练方案。实验结果表明,所提出的sg-LSTM模型在成功描述输入图像关键组成部分方面优于传统的当前最佳(state-of-the-art)多模态RNN描述框架。

关键词

引用

@article{arxiv.1709.05038,
  title  = {Self-Guiding Multimodal LSTM - when we do not have a perfect training dataset for image captioning},
  author = {Yang Xian and Yingli Tian},
  journal= {arXiv preprint arXiv:1709.05038},
  year   = {2017}
}

备注

The paper is under consideration at Computer Vision and Image Understanding