通过序列级探索改进图像与视频描述生成
计算机视觉与模式识别
2020-03-10 v1
摘要
序列级学习目标已广泛用于描述生成任务,以使众多模型达到最优性能。在该目标下,模型以其生成描述的(序列级)质量奖励进行训练。本工作中,我们从理论与实证结果两方面指出了当前序列级学习目标在描述任务中的局限性。理论上,我们表明当前目标等价于仅优化模型所生成描述集合的准确率(precision)一侧,从而忽略了召回率(recall)一侧。实证结果显示,依此目标训练的模型在召回率一侧得分倾向更低。我们提出在当前目标中增加序列级探索项以提升召回率,其引导模型在训练中探索更多合理描述。如此,所提目标同时考虑了生成描述的准确率与召回率两方面。实验表明了该方法在视频与图像描述数据集上的有效性。
引用
@article{arxiv.2003.03749,
title = {Better Captioning with Sequence-Level Exploration},
author = {Jia Chen and Qin Jin},
journal= {arXiv preprint arXiv:2003.03749},
year = {2020}
}
备注
accepted by CVPR 2020