基于局部目标注意力与全局语义上下文建模的序列图像描述生成
计算与语言
2020-12-03 v1 计算机视觉与模式识别
摘要
本文提出一种端到端的 CNN-LSTM 模型,利用局部目标注意力机制为序列图像生成描述。为生成连贯的描述,我们使用多层感知机捕获全局语义上下文,学习序列图像之间的依赖关系。采用并行 LSTM 网络解码序列描述。实验结果表明,在 Microsoft 发布的数据集上,我们的模型在三种不同评价指标上均优于基线。
引用
@article{arxiv.2012.01295,
title = {Generating Descriptions for Sequential Images with Local-Object Attention and Global Semantic Context Modelling},
author = {Jing Su and Chenghua Lin and Mian Zhou and Qingyun Dai and Haoyu Lv},
journal= {arXiv preprint arXiv:2012.01295},
year = {2020}
}
备注
Accepted by INLG 2018