simNet:用于生成详尽且全面图像描述的分步图像-主题融合网络
计算与语言
2018-08-28 v1
摘要
编码-解码框架在图像描述生成中已展现出近期成功。善于细节化的视觉注意与善于全面性的语义注意已被分别提出以将描述立足于图像。本文中,我们提出分步图像-主题融合网络(simNet),其同时利用这两类注意。在生成描述的每个时间步,解码器根据已生成上下文自适应地融合所提取主题与图像中的注意信息,从而使视觉信息与语义信息得以有效结合。所提方法在两个基准数据集上评估并达到了SOTA性能。(代码见 https://github.com/lancopku/simNet)
引用
@article{arxiv.1808.08732,
title = {simNet: Stepwise Image-Topic Merging Network for Generating Detailed and Comprehensive Image Captions},
author = {Fenglin Liu and Xuancheng Ren and Yuanxin Liu and Houfeng Wang and Xu Sun},
journal= {arXiv preprint arXiv:1808.08732},
year = {2018}
}
备注
Accepted by Conference on Empirical Methods in Natural Language Processing 2018