MAT:用于图像描述的多模态注意力翻译器
计算机视觉与模式识别
2017-08-11 v3
摘要
在本工作中,我们将图像描述问题表述为多模态翻译任务。类比机器翻译,我们提出一种序列到序列的循环神经网络(RNN)模型用于图像描述生成。与大多数将整幅图像用卷积神经网络(CNN)特征表示的工作不同,我们提议将输入图像表示为检测到的对象序列,作为RNN模型的源序列。通过这种方式,图像的序列表示可以自然地被翻译为词序列,作为RNN模型的目标序列。为了以序列方式表示图像,我们提取图像中的对象特征并使用卷积神经网络将其排列有序。为了进一步利用编码对象的视觉信息,引入了序列注意力层以选择性地关注与生成句子中相应词相关的对象。在流行基准数据集MS COCO上进行了大量实验来验证所提方法,并且所提模型在以往工作的数据集划分下在所有指标上超越了state-of-the-art方法。所提方法也通过MS COCO描述挑战的评估服务器进行了评估,取得了极具竞争力的结果,例如CIDEr为1.029 (c5)和1.064 (c40)。
引用
@article{arxiv.1702.05658,
title = {MAT: A Multimodal Attentive Translator for Image Captioning},
author = {Chang Liu and Fuchun Sun and Changhu Wang and Feng Wang and Alan Yuille},
journal= {arXiv preprint arXiv:1702.05658},
year = {2017}
}