利用自然语言先验改进基于强化学习的图像描述生成
计算机视觉与模式识别
2018-09-18 v1 机器学习
机器学习
摘要
近来,强化学习(RL)方法通过直接优化测试所用指标,在图像描述生成中展现出先进性能。然而,这种塑形奖励引入了学习偏差,降低了生成文本的可读性。此外,巨大的动作空间使训练不稳定且缓慢。为缓解这些问题,我们提出了一种简洁连贯的方案,利用n-gram语言先验约束动作空间。在基准上的定量与定性评估表明,带有该简单附加模块的RL在可读性与收敛速度方面均优于其对应方法。人工评估结果显示,我们的模型更具人类可读性与优雅性。代码将在论文被接收后公开。
引用
@article{arxiv.1809.06227,
title = {Improving Reinforcement Learning Based Image Captioning with Natural Language Prior},
author = {Tszhang Guo and Shiyu Chang and Mo Yu and Kun Bai},
journal= {arXiv preprint arXiv:1809.06227},
year = {2018}
}
备注
8 pages, 5 figures, EMNLP2018