基于比较与重加权的独特图像描述生成
计算机视觉与模式识别
2022-04-11 v1 人工智能
摘要
近年来,基于流行的评价指标(即 BLEU、CIDEr 和 SPICE),图像描述模型取得了令人瞩目的成果。然而,仅关注生成描述与人工标注之间重叠度的最流行指标,可能导致使用常见词汇和短语,从而缺乏独特性,即许多相似图像具有相同的描述。本文旨在通过与一组相似图像进行比较和重加权来提高图像描述的独特性。首先,我们提出了一种独特性指标——集合间 CIDEr (CIDErBtw),用于评估某描述相对于相似图像描述的独特性。我们的指标表明,在 MSCOCO 数据集中,每张图像的人工标注在独特性上并不等价;然而,以往的工作在训练期间通常将人工标注同等对待,这可能是生成描述缺乏独特性的原因之一。相比之下,我们在训练期间根据每条真实描述的独特性对其进行重加权。我们进一步整合了长尾加权策略,以突出包含更多信息的罕见词汇,并将来自相似图像集的描述作为负样本进行采样,以促使生成的句子具有唯一性。最后,我们进行了大量实验,结果表明,对于多种图像描述基线模型,我们提出的方法显著提高了独特性(由 CIDErBtw 和检索指标衡量)和准确性(例如由 CIDEr 衡量)。用户研究进一步证实了这些结果。
引用
@article{arxiv.2204.03938,
title = {On Distinctive Image Captioning via Comparing and Reweighting},
author = {Jiuniu Wang and Wenjia Xu and Qingzhong Wang and Antoni B. Chan},
journal= {arXiv preprint arXiv:2204.03938},
year = {2022}
}
备注
20 pages. arXiv admin note: substantial text overlap with arXiv:2007.06877