中文

带有嵌入奖励的基于深度强化学习的图像描述生成

计算机视觉与模式识别 2017-04-14 v1 人工智能

摘要

图像描述生成因理解图像内容和自然语言多样描述的复杂性而具有挑战性。深度神经网络的最新进展显著提升了该任务的性能。大多数最先进的方法遵循编码器-解码器框架,使用顺序循环预测模型生成描述。然而,本文引入一种新颖的图像描述决策框架。我们利用“策略网络”和“价值网络”协作生成描述。策略网络通过根据当前状态提供预测下一个词的置信度作为局部指导。此外,价值网络通过评估当前状态的所有可能扩展作为全局和前瞻指导。本质上,它将预测正确词的目标调整为生成与地面真实描述相似的描述的目标。我们使用演员-评论家(actor-critic)强化学习模型训练两个网络,奖励由视觉-语义嵌入定义。在Microsoft COCO数据集上的大量实验和分析表明,所提框架在不同评估指标上优于最先进的方法。

关键词

引用

@article{arxiv.1704.03899,
  title  = {Deep Reinforcement Learning-based Image Captioning with Embedding Reward},
  author = {Zhou Ren and Xiaoyu Wang and Ning Zhang and Xutao Lv and Li-Jia Li},
  journal= {arXiv preprint arXiv:1704.03899},
  year   = {2017}
}