中文

通过SPIDEr的策略梯度优化改进图像描述生成

计算机视觉与模式识别 2018-03-14 v4 计算与语言

摘要

当前的图像描述生成方法通常通过(带惩罚的)最大似然估计进行训练。然而,描述句子的对数似然得分与人类质量评估的相关性不佳。标准的句法评价指标,如BLEU、METEOR和ROUGE,相关性也不好。较新的SPICE和CIDEr指标相关性较好,但传统上难以优化。在本文中,我们展示如何使用策略梯度(PG)方法直接优化SPICE和CIDEr的线性组合(我们称之为SPIDEr的组合):SPICE得分确保我们的描述在语义上忠实于图像,而CIDEr得分确保我们的描述在句法上流畅。我们提出的PG方法改进了先前的MIXER方法,其通过使用蒙特卡洛 rollouts 而非混合 MLE 训练与 PG。我们通过实验表明,与MIXER相比,我们的算法实现了更简便的优化和更好的结果。最后,我们展示使用我们的PG方法可以优化任意指标,包括所提出的SPIDEr指标,其产生的图像描述相比由同一模型但训练用于优化MLE或COCO指标所生成的描述,更受人类评分者的强烈偏好。

关键词

引用

@article{arxiv.1612.00370,
  title  = {Improved Image Captioning via Policy Gradient optimization of SPIDEr},
  author = {Siqi Liu and Zhenhai Zhu and Ning Ye and Sergio Guadarrama and Kevin Murphy},
  journal= {arXiv preprint arXiv:1612.00370},
  year   = {2018}
}

备注

Accepted at ICCV 2017