中文

基于共识的序列训练用于视频字幕生成

计算机视觉与模式识别 2017-12-29 v1

摘要

字幕生成模型通常使用交叉熵损失进行训练。然而,其性能是通过其他旨在更好与人类评估相关的指标来衡量的。最近研究表明,强化学习(RL)可直接在诸如字幕生成等任务中优化这些指标。但这在计算上代价高昂,且需要每一步指定基线奖励以使训练收敛。我们提出一种通过 REINFORCE 算法优化所关注目标的快速方法。首先我们表明,通过将模型采样替换为真实句子,RL 训练可视为一种加权交叉熵损失,从而得到快速的、基于 RL 的预训练算法。其次,我们提出使用同一视频的真实字幕之间的共识作为基线奖励。这可被非常高效地计算。我们将完整方案称为基于共识的序列训练(CST)。应用于 MSRVTT 视频字幕生成基准,我们的方案比可比方法训练显著更快,并确立了该任务上的新 SOTA,将 CIDEr 分数从 47.3 提升至 54.2。

关键词

引用

@article{arxiv.1712.09532,
  title  = {Consensus-based Sequence Training for Video Captioning},
  author = {Sang Phan and Gustav Eje Henter and Yusuke Miyao and Shin'ichi Satoh},
  journal= {arXiv preprint arXiv:1712.09532},
  year   = {2017}
}

备注

11 pages, 4 figures, 5 tables. Github repo at https://github.com/mynlp/cst_captioning