中文

用于图像描述的自批判n步训练

计算机视觉与模式识别 2019-04-16 v1 计算与语言 机器学习

摘要

现有的图像描述方法通常通过交叉熵损失训练,这导致暴露偏差以及优化函数与评估指标之间的不一致。最近研究表明,这两个问题可通过引入强化学习技术来解决,其中流行技术之一是利用参数化估计器估计状态值以计算逐词优势的优势演员-评论家算法,但代价是引入估计偏差。本文中,我们在不使用参数化值估计器的情况下估计状态值。利用图像描述的确定性状态转移函数和稀疏奖励特性,状态值等价于其前驱状态-动作值,我们通过简单地用后者替换前者重新表述优势函数。此外,将重新表述的优势扩展至n步,通常可在降低方差的同时增大其均值的绝对值。随后采用两种rollout估计状态-动作值,我们称之为自批判n步训练。经验上,我们发现相较于在广泛使用的MSCOCO基准上分别使用序列级优势和参数化估计器的最先进方法,我们的方法能获得更好的性能。

关键词

引用

@article{arxiv.1904.06861,
  title  = {Self-critical n-step Training for Image Captioning},
  author = {Junlong Gao and Shiqi Wang and Shanshe Wang and Siwei Ma and Wen Gao},
  journal= {arXiv preprint arXiv:1904.06861},
  year   = {2019}
}

备注

CVPR2019