隐状态引导:利用图像条件自编码器改进图像描述生成
计算机视觉与模式识别
2020-01-16 v2 计算与语言
摘要
大多数基于 RNN 的图像描述模型在输出词上接受监督以模仿人类描述。因此,隐状态只能通过随时间反向传播的各层获得含噪梯度信号,导致生成的描述不够准确。为此,我们提出一种新颖框架——隐状态引导(HSG),其将描述解码器中的隐状态与在更易的、以图像为条件的描述自编码任务上训练的教师解码器中的隐状态进行匹配。在使用 REINFORCE 算法训练时,常规奖励是基于句子的评估指标,均等地分配给每个生成的词,无论其相关性如何。HSG 提供了一种词级奖励,帮助模型学习更好的隐表示。实验结果表明,HSG 明显优于以原始图像或检测对象为输入的各种最先进描述解码器。
引用
@article{arxiv.1910.14208,
title = {Hidden State Guidance: Improving Image Captioning using An Image Conditioned Autoencoder},
author = {Jialin Wu and Raymond J. Mooney},
journal= {arXiv preprint arXiv:1910.14208},
year = {2020}
}