中文

像人类一样描述:图像描述中的多样性

计算机视觉与模式识别 2019-05-16 v3

摘要

近年来,基于最流行的指标(如 BLEU、METEOR、ROUGE 和 CIDEr),图像描述的最先进模型已超越人类表现。这是否意味着我们已经解决了图像描述任务?上述指标仅衡量生成的描述与人工标注之间的相似度,这反映了其准确性。然而,一幅图像包含许多概念和多个层次的细节,因此存在多种描述来表达不同的概念和细节,这可能对不同的用户而言是有趣的。因此,仅评估准确性不足以衡量描述模型的性能——还应考虑生成描述的多样性。在本文中,我们提出了一种新的用于衡量图像描述多样性的指标,该指标源自潜在语义分析并经过核化以使用 CIDEr 相似度。我们进行了广泛的实验,在多样性和准确性的背景下重新评估了近期的描述模型。我们发现,在准确性和多样性方面,模型与人类表现之间仍存在较大差距,且已优化准确性(CIDEr)的模型具有较低的多样性。我们还表明,在训练期间的强化学习中平衡交叉熵损失和 CIDEr 奖励,可以有效控制生成描述在多样性和准确性之间的权衡。

关键词

引用

@article{arxiv.1903.12020,
  title  = {Describing like humans: on diversity in image captioning},
  author = {Qingzhong Wang and Antoni B. Chan},
  journal= {arXiv preprint arXiv:1903.12020},
  year   = {2019}
}

备注

Accepted by CVPR2019. In this version, we correct the label of y axis in figure 8