为图像描述生成进行更多次注意力
计算机视觉与模式识别
2019-02-12 v2
摘要
多数基于注意力的图像描述生成模型每个词对图像进行一次注意力。然而,每个词仅注意力一次是僵化的,且容易遗漏某些信息。进行更多次注意力可调整注意力位置、找回遗漏信息并避免生成错误词汇。本文表明,每个词进行更多次注意力可在不增加参数量的情况下提升图像描述生成任务表现。我们提出一种灵活的双 LSTM 融合模型,以方便编码多于词汇数的注意力。我们的描述生成模型使用两个 LSTM 分别编码词序列与注意力序列。两个 LSTM 的信息与图像特征相融合以预测下一个词。在 MSCOCO 描述数据集上的实验表明,我们的方法优于 SOTA。使用自底向上特征与自我批判训练方法,我们的方法在 Karpathy 测试划分上取得 BLEU-4、METEOR、ROUGE-L、CIDEr 与 SPICE 分数分别为 0.381、0.283、0.580、1.261 与 0.220。
引用
@article{arxiv.1812.03283,
title = {Attend More Times for Image Captioning},
author = {Jiajun Du and Yu Qin and Hongtao Lu and Yonghua Zhang},
journal= {arXiv preprint arXiv:1812.03283},
year = {2019}
}