中文

用于多样化视觉段落生成的 Curiosity 驱动强化学习

计算机视觉与模式识别 2019-08-30 v2

摘要

视觉段落生成旨在从不同视角自动描述给定图像,并以连贯方式组织句子。本文在强化学习设定下解决该任务的三大关键挑战:模式崩塌、延迟反馈与策略网络耗时的预热。总体上,我们提出一种新颖的 Curiosity 驱动强化学习(CRL)框架,以联合提升生成段落的多样性与准确性。首先,通过将段落描述建模为长期决策过程,并将状态转移的预测不确定性度量作为内在奖励,模型被激励将精确但罕见的描述记忆到上下文中,而非偏向频繁片段与通用模式。其次,由于来自评估的外在奖励仅在完整段落生成后才可用,我们通过时序差分学习在每个时间步估计其期望值,考量连续动作间的相关性。随后估计的外在奖励由派生好奇心模块产生的稠密内在奖励补充,以鼓励策略充分探索动作空间并找到全局最优。第三,集成折扣模仿学习以从人类示范中学习,无需事先单独执行耗时的预热。在 Stanford 图像-段落数据集上的大量实验证明了所提方法的有效性与高效性,相较最先进水平(SOTA)性能提升 38.4%。

关键词

引用

@article{arxiv.1908.00169,
  title  = {Curiosity-driven Reinforcement Learning for Diverse Visual Paragraph Generation},
  author = {Yadan Luo and Zi Huang and Zheng Zhang and Ziwei Wang and Jingjing Li and Yang Yang},
  journal= {arXiv preprint arXiv:1908.00169},
  year   = {2019}
}