Stack-VS: 用于图像描述生成的堆叠视觉-语义注意力
计算机视觉与模式识别
2019-09-06 v1 计算与语言
摘要
近年来,自动图像描述生成已成为多模态翻译任务研究的重要焦点。现有方法可粗略分为两类,即自顶向下与自底向上:前者将图像信息(称为视觉级特征)直接转为描述,后者利用提取的词(称为语义级属性)生成描述。然而,先前方法要么基于单阶段解码器,要么仅部分利用视觉级或语义级信息用于图像描述生成。本文解决该问题并提出一种创新的多阶段架构(称为Stack-VS)以生成丰富的细粒度图像描述,通过结合自底向上与自顶向下注意力模型来有效处理输入图像的视觉级与语义级信息。具体而言,我们还提出一种新颖且精心设计的堆叠解码器模型,其由一串解码单元构成,每个单元包含两层LSTM以交互方式重新优化视觉级特征向量与语义级属性嵌入上的注意力权重,从而生成细粒度图像描述。在流行基准数据集MSCOCO上的大量实验表明,相较于当前最优方法,不同评价指标均有显著提升,即BLEU-4/CIDEr/SPICE分数分别提升0.372、1.226和0.216。
引用
@article{arxiv.1909.02489,
title = {Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation},
author = {Wei Wei and Ling Cheng and Xianling Mao and Guangyou Zhou and Feida Zhu},
journal= {arXiv preprint arXiv:1909.02489},
year = {2019}
}
备注
12 pages, 7 figures