Show, Attend and Tell:基于视觉注意力的神经图像描述生成
机器学习
2016-04-20 v3 计算机视觉与模式识别
摘要
受机器翻译与目标检测近期工作的启发,我们提出了一种基于注意力的模型,可自动学习描述图像内容。我们描述了如何使用标准反向传播技术以确定性方式训练该模型,以及通过最大化变分下界以随机方式训练。我们还通过可视化展示该模型如何在生成输出序列中对应单词的同时,自动学习将注视点固定在显著物体上。我们在三个基准数据集 Flickr8k、Flickr30k 和 MS COCO 上以最先进的性能验证了注意力的使用。
引用
@article{arxiv.1502.03044,
title = {Show, Attend and Tell: Neural Image Caption Generation with Visual Attention},
author = {Kelvin Xu and Jimmy Ba and Ryan Kiros and Kyunghyun Cho and Aaron Courville and Ruslan Salakhutdinov and Richard Zemel and Yoshua Bengio},
journal= {arXiv preprint arXiv:1502.03044},
year = {2016}
}