Stack-Captioning:用于图像描述的由粗到细学习
计算机视觉与模式识别
2018-03-15 v3
摘要
现有的图像描述方法通常训练单阶段句子解码器,难以生成丰富的细粒度描述。另一方面,多阶段图像描述模型由于梯度消失问题难以训练。本文提出一种用于图像描述的由粗到细多阶段预测框架,由多个解码器组成,每个解码器在前一阶段输出上操作,产生逐渐精炼的图像描述。我们提出的学习方法通过提供强制中间监督的学习目标函数,解决了训练期间梯度消失的困难。特别地,我们用强化学习方法优化模型,该方法利用每个中间解码器的测试时推断算法输出以及其前驱解码器的输出来规范化奖励,同时解决了著名的暴露偏差问题和损失-评估不匹配问题。我们在MSCOCO上广泛评估所提方法,并展示我们的方法能达到最先进性能。
引用
@article{arxiv.1709.03376,
title = {Stack-Captioning: Coarse-to-Fine Learning for Image Captioning},
author = {Jiuxiang Gu and Jianfei Cai and Gang Wang and Tsuhan Chen},
journal= {arXiv preprint arXiv:1709.03376},
year = {2018}
}
备注
AAAI-2018, Oral Presentation