基于深度双向LSTM的图像描述生成
计算机视觉与模式识别
2016-07-21 v3 计算与语言
多媒体
摘要
本工作提出了一种端到端可训练的深度双向LSTM(长短期记忆)模型用于图像描述生成。我们的模型构建于深度卷积神经网络(CNN)和两个独立的LSTM网络之上。它能够通过在高级语义空间利用历史和未来上下文信息来学习长期的视觉-语言交互。提出了两种新颖的深度双向变体模型,以不同方式增加非线性变换的深度,用于学习分层视觉-语言嵌入。提出了多裁剪、多尺度和垂直镜像等数据增强技术,以防止深度模型训练中的过拟合。我们可视化了双向LSTM内部状态随时间的演化,并定性分析了我们的模型如何将图像“翻译”为句子。我们提出的模型在图像描述生成和图像-句子检索任务上用三个基准数据集进行了评估:Flickr8K、Flickr30K和MSCOCO数据集。我们证明,双向LSTM模型在描述生成上即使不集成额外机制(例如目标检测、注意力模型等)也能取得与最先进结果极具竞争力的性能,并在检索任务上显著优于近期方法。
引用
@article{arxiv.1604.00790,
title = {Image Captioning with Deep Bidirectional LSTMs},
author = {Cheng Wang and Haojin Yang and Christian Bartz and Christoph Meinel},
journal= {arXiv preprint arXiv:1604.00790},
year = {2016}
}
备注
accepted by ACMMM 2016 as full paper and oral presentation