EMScore:通过粗粒度与细粒度嵌入匹配评估视频字幕
计算机视觉与模式识别
2022-07-19 v2
摘要
当前视频字幕指标大多基于参考字幕与候选字幕之间的文本级比较。然而,它们存在一些不可克服的缺陷,例如无法处理无参考视频,且可能因视频到文本的一对多特性以及对视觉相关性的忽视而导致偏倚评估。从人类评估者的视角看,高质量字幕应与所给视频一致,而不必在字面或语义上与参考相似。受人类评估启发,我们提出 EMScore(基于嵌入匹配的分数),一种新颖的免参考视频字幕指标,其直接度量视频与候选字幕之间的相似度。得益于大规模预训练模型近期的发展,我们利用一个良好预训练的视觉-语言模型提取视觉与语言嵌入以计算 EMScore。具体而言,EMScore 结合了粗粒度(视频与字幕)与细粒度(帧与词)两级的匹配分数,从而兼顾视频的整体理解与细节特征。此外,考虑到潜在信息增益,EMScore 可灵活扩展至有人工标注参考可用的情形。最后,我们收集了 VATEX-EVAL 与 ActivityNet-FOIl 数据集以系统评估现有指标。VATEX-EVAL 实验表明 EMScore 具有更高的人类相关性与更低的参考依赖性。ActivityNet-FOIL 实验验证了 EMScore 能有效识别“幻觉”字幕。数据集将公开以促进视频字幕指标的发展。代码见:https://github.com/ShiYaya/emscore。
引用
@article{arxiv.2111.08919,
title = {EMScore: Evaluating Video Captioning via Coarse-Grained and Fine-Grained Embedding Matching},
author = {Yaya Shi and Xu Yang and Haiyang Xu and Chunfeng Yuan and Bing Li and Weiming Hu and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2111.08919},
year = {2022}
}
备注
cvpr2022