用于图像字幕的主题引导注意力
计算机视觉与模式识别
2018-07-11 v1
摘要
注意力机制因其强大的性能在图像字幕中引起了相当大的关注。现有的基于注意力的模型利用来自字幕生成器的反馈信息作为引导,以确定应关注哪些图像特征。这些注意力生成方法的共同缺陷是缺乏来自图像本身更高层次的引导信息,这限制了对最具信息量的图像特征的选择。因此,本文提出一种新颖的注意力机制,称为主题引导注意力(topic-guided attention),其将图像主题作为引导信息整合到注意力模型中,以帮助选择最重要的图像特征。此外,我们使用独立的网络提取图像特征和图像主题,这些网络在训练过程中可以以端到端的方式联合微调。在基准 Microsoft COCO 数据集上的实验结果表明,我们的方法在各种量化指标上取得了最先进的(state-of-art)性能。
引用
@article{arxiv.1807.03514,
title = {Topic-Guided Attention for Image Captioning},
author = {Zhihao Zhu and Zhan Xue and Zejian Yuan},
journal= {arXiv preprint arXiv:1807.03514},
year = {2018}
}
备注
Accepted by ICIP 2018