图像描述生成中多样性与准确性权衡的分析
计算与语言
2020-02-28 v1 计算机视觉与模式识别
摘要
我们研究了不同模型架构、训练目标、超参数设置和解码过程对自动生成图像描述多样性的影响。我们的结果表明:1)通过朴素采样进行的简单解码,配合低温设置,是一种具有竞争力且快速的方法,可生成多样且准确的描述集合;2)使用基于 CIDEr 的奖励进行强化学习训练会损害所得生成器的多样性特性,且无法通过操纵解码参数来缓解。此外,我们提出了一种新指标 AllSPICE,用于通过单一数值评估一组描述的准确性与多样性。
引用
@article{arxiv.2002.11848,
title = {Analysis of diversity-accuracy tradeoff in image captioning},
author = {Ruotian Luo and Gregory Shakhnarovich},
journal= {arXiv preprint arXiv:2002.11848},
year = {2020}
}