中文

用于图像字幕生成的自批判序列训练 (Self-critical Sequence Training)

机器学习 2017-11-17 v2 人工智能 计算机视觉与模式识别

摘要

近来研究表明,强化学习的策略梯度方法可用于直接针对当前任务的非可微指标训练深度端到端系统。本文考虑利用强化学习优化图像字幕生成系统的问题,并表明通过利用 MSCOCO 任务的测试指标仔细优化系统,可以实现显著的性能提升。我们的系统采用一种称为自批判序列训练 (Self-critical Sequence Training, SCST) 的新优化方法构建。SCST 是流行的 REINFORCE 算法的一种形式,它不估计“基线”来归一化奖励并降低方差,而是利用自身测试时推断算法的输出对所受奖励进行归一化。使用该方法,避免了估计奖励信号(如 actor-critic 方法必须做的)和估计归一化(如 REINFORCE 算法通常做的),同时使模型与其测试时推断过程相协调。经验上,我们发现用 SCST 直接优化 CIDEr 指标且在测试时采用贪婪解码非常有效。我们在 MSCOCO 评估服务器上的结果确立了该任务的新最优性能 (state-of-the-art),将 CIDEr 的最佳结果从 104.9 提升至 114.7。

关键词

引用

@article{arxiv.1612.00563,
  title  = {Self-critical Sequence Training for Image Captioning},
  author = {Steven J. Rennie and Etienne Marcheret and Youssef Mroueh and Jarret Ross and Vaibhava Goel},
  journal= {arXiv preprint arXiv:1612.00563},
  year   = {2017}
}

备注

CVPR 2017 + additional analysis + fixed baseline results, 16 pages