用于训练描述性字幕的可区分性目标函数
计算机视觉与模式识别
2018-06-12 v2
摘要
当代方法生成的图像字幕仍缺乏的一种特性是可区分性:在给定其中一张图像的字幕时,能够区分两幅图像。我们提出了一种改进字幕生成这一方面的方法。通过在字幕训练目标中引入一个与(机器)消除图像/字幕匹配歧义能力直接相关的损失分量,根据人工评估,我们得到了能生成更具区分性字幕的系统。值得注意的是,我们的方法还改善了生成字幕的其他方面,这反映在一组标准分数(如BLEU、SPICE等)的提升上。我们的方法是模块化的,可应用于图像字幕生成中常见的多种模型/损失组合。
引用
@article{arxiv.1803.04376,
title = {Discriminability objective for training descriptive captions},
author = {Ruotian Luo and Brian Price and Scott Cohen and Gregory Shakhnarovich},
journal= {arXiv preprint arXiv:1803.04376},
year = {2018}
}
备注
CVPR2018