用于图像与视频字幕评估的正向增强对比学习
计算机视觉与模式识别
2023-07-21 v3 人工智能
计算与语言
多媒体
摘要
CLIP模型近来被证明对多种跨模态任务非常有效,包括评估来自视觉-语言架构生成的字幕。在本文中,我们提出了一种用于图像字幕的基于对比的评估指标的新方案,即正向增强对比学习分数(PAC-S),它以一种新颖的方式将对比视觉-语义空间的学习与在精选数据上添加生成的图像和文本相统一。跨越多个数据集的实验表明,我们的新指标在图像和视频上均与人类判断具有最高相关性,优于现有的基于参考的指标(如CIDEr和SPICE)以及无参考指标(如CLIP-Score)。最后,我们在考虑流行图像字幕方法时测试了所提指标的系统性相关性,并评估了采用不同跨模态特征的影响。我们的源代码和训练模型公开于:https://github.com/aimagelab/pacscore。
引用
@article{arxiv.2303.12112,
title = {Positive-Augmented Contrastive Learning for Image and Video Captioning Evaluation},
author = {Sara Sarto and Manuele Barraco and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
journal= {arXiv preprint arXiv:2303.12112},
year = {2023}
}
备注
CVPR 2023 (highlight paper)