中文

CIDEr-R:基于鲁棒共识的图像描述评测

计算机视觉与模式识别 2021-09-29 v1 计算与语言

摘要

本文表明,传统图像描述评测指标 CIDEr-D 在句子词数显著多于 MS COCO Captions 数据集的数据集上不能正常工作。我们还表明 CIDEr-D 因缺乏多参考句及句子长度高方差而性能受限。为规避此问题,我们引入 CIDEr-R,其改进了 CIDEr-D,使其在应对高句子长度方差的数据集时更灵活。我们证明 CIDEr-R 比 CIDEr-D 更准确且更贴近人类判断;CIDEr-R 在可用参考句数量方面更具鲁棒性。我们的结果显示,使用自批判序列训练(Self-Critical Sequence Training)优化 CIDEr-R 可生成描述性标题。相反,当优化 CIDEr-D 时,生成标题的长度趋于与参考长度相似,但模型也会重复同一词多次以增加句子长度。

关键词

引用

@article{arxiv.2109.13701,
  title  = {CIDEr-R: Robust Consensus-based Image Description Evaluation},
  author = {Gabriel Oliveira dos Santos and Esther Luna Colombini and Sandra Avila},
  journal= {arXiv preprint arXiv:2109.13701},
  year   = {2021}
}

备注

Paper accepted to the 7th Workshop on Noisy User-generated Text (W-NUT). 10 pages, 4 figures, 3 tables