中文

基于局部目标注意力与全局语义上下文建模的序列图像描述生成

计算与语言 2020-12-03 v1 计算机视觉与模式识别

摘要

本文提出一种端到端的 CNN-LSTM 模型,利用局部目标注意力机制为序列图像生成描述。为生成连贯的描述,我们使用多层感知机捕获全局语义上下文,学习序列图像之间的依赖关系。采用并行 LSTM 网络解码序列描述。实验结果表明,在 Microsoft 发布的数据集上,我们的模型在三种不同评价指标上均优于基线。

关键词

引用

@article{arxiv.2012.01295,
  title  = {Generating Descriptions for Sequential Images with Local-Object Attention and Global Semantic Context Modelling},
  author = {Jing Su and Chenghua Lin and Mian Zhou and Qingyun Dai and Haoyu Lv},
  journal= {arXiv preprint arXiv:2012.01295},
  year   = {2020}
}

备注

Accepted by INLG 2018