中文

用于图像与视频字幕评估的正向增强对比学习

计算机视觉与模式识别 2023-07-21 v3 人工智能 计算与语言 多媒体

摘要

CLIP模型近来被证明对多种跨模态任务非常有效,包括评估来自视觉-语言架构生成的字幕。在本文中,我们提出了一种用于图像字幕的基于对比的评估指标的新方案,即正向增强对比学习分数(PAC-S),它以一种新颖的方式将对比视觉-语义空间的学习与在精选数据上添加生成的图像和文本相统一。跨越多个数据集的实验表明,我们的新指标在图像和视频上均与人类判断具有最高相关性,优于现有的基于参考的指标(如CIDEr和SPICE)以及无参考指标(如CLIP-Score)。最后,我们在考虑流行图像字幕方法时测试了所提指标的系统性相关性,并评估了采用不同跨模态特征的影响。我们的源代码和训练模型公开于:https://github.com/aimagelab/pacscore。

关键词

引用

@article{arxiv.2303.12112,
  title  = {Positive-Augmented Contrastive Learning for Image and Video Captioning Evaluation},
  author = {Sara Sarto and Manuele Barraco and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2303.12112},
  year   = {2023}
}

备注

CVPR 2023 (highlight paper)