CIDEr-R:基于鲁棒共识的图像描述评测
计算机视觉与模式识别
2021-09-29 v1 计算与语言
摘要
本文表明,传统图像描述评测指标 CIDEr-D 在句子词数显著多于 MS COCO Captions 数据集的数据集上不能正常工作。我们还表明 CIDEr-D 因缺乏多参考句及句子长度高方差而性能受限。为规避此问题,我们引入 CIDEr-R,其改进了 CIDEr-D,使其在应对高句子长度方差的数据集时更灵活。我们证明 CIDEr-R 比 CIDEr-D 更准确且更贴近人类判断;CIDEr-R 在可用参考句数量方面更具鲁棒性。我们的结果显示,使用自批判序列训练(Self-Critical Sequence Training)优化 CIDEr-R 可生成描述性标题。相反,当优化 CIDEr-D 时,生成标题的长度趋于与参考长度相似,但模型也会重复同一词多次以增加句子长度。
引用
@article{arxiv.2109.13701,
title = {CIDEr-R: Robust Consensus-based Image Description Evaluation},
author = {Gabriel Oliveira dos Santos and Esther Luna Colombini and Sandra Avila},
journal= {arXiv preprint arXiv:2109.13701},
year = {2021}
}
备注
Paper accepted to the 7th Workshop on Noisy User-generated Text (W-NUT). 10 pages, 4 figures, 3 tables