图像描述生成的内在评价
计算机视觉与模式识别
2020-12-15 v1
摘要
图像描述生成任务旨在从图像生成恰当的描述。该任务面临若干挑战,如准确性、流畅性与多样性。然而现有少数度量指标能在评价描述生成模型结果时涵盖所有这些性质。本文首先对当代度量指标进行了全面调研。受自编码器机制与词嵌入研究进展的启发,我们提出了一种基于学习的图像描述生成度量指标,称为内在图像描述生成评价(I2CE)。我们选取若干最先进(SOTA)的图像描述生成模型,并在 MS COCO 数据集上依据当代度量指标与所提 I2CE 测试其性能。实验结果表明,当遇到语义相似表达或语义较不对齐时,我们所提方法能保持稳健性能,并对候选描述给出更灵活的分数。就此而言,所提度量可作为描述间内在信息的全新指示量,对已有指标或有补充作用。
引用
@article{arxiv.2012.07333,
title = {Intrinsic Image Captioning Evaluation},
author = {Chao Zeng and Sam Kwong},
journal= {arXiv preprint arXiv:2012.07333},
year = {2020}
}