基于 V\&L Transformer、CLIP 与精确-召回的 VCRScore 图像描述评估指标
计算机视觉与模式识别
2025-01-28 v2 计算与语言
摘要
图像描述已成为重要的视觉-语言研究任务,旨在给定特定图像或视频预测最准确的描述。研究社区通过不断提出新模型和方法来提高整体模型性能,但尽管提出了大量方案,衡量这些进展的性能指标实际上多年来几乎未被触动。目前,BLEU、METEOR、CIDEr、ROUGE 等指标仍被广泛使用,除此之外还有更精细的指标如 BertScore 和 ClipScore。因此,有必要调整如何衡量新图像描述方案的进展、局限性和适用范围,以及为这些新方法引入新的评估指标。本 work 提出了一种新的图像描述评估指标。为此,我们首先生成了以人类标注数据为基准的评估数据集,以衡量描述与图像内容的关联程度。以这些人类得分作为基准,我们提出了新的指标,并与几类经典及新型指标进行比较。我们发现新的指标表现优越,并提供了有趣的见解和讨论。
引用
@article{arxiv.2501.09155,
title = {VCRScore: Image captioning metric based on V\&L Transformers, CLIP, and precision-recall},
author = {Guillermo Ruiz and Tania Ramírez and Daniela Moctezuma},
journal= {arXiv preprint arXiv:2501.09155},
year = {2025}
}
备注
28 pages