中文

G-VEval:用于评估图像和视频标题的通用指标

计算机视觉与模式识别 2024-12-20 v2 人工智能 计算与语言

摘要

视觉标题评估指标至关重要却未得到充分探讨。传统指标如BLEU、METEOR、CIDEr和ROUGE常常忽略语义深度,而经过训练的指标如CLIP-Score、PAC-S和Polos在零样本情境下受限。高级语言模型基于指标也难以与细腻的人类偏好保持一致。为此,我们引入G-VEval,这一灵感来源于G-Eval、由新型GPT-4o驱动的新型指标。G-VEval利用大型多模态模型中的链条推理,支持三种模式:无参考、仅参考和组合,兼容视频和图像输入。我们还提出MSVD-Eval,这是一个新的视频标题评估数据集,以建立更透明、更一致的框架,供人类专家和评估指标使用。该数据集旨在解决现有数据集缺乏明确标准问题,通过引入准确性、完整性、简洁性和相关性四个维度(ACCR)来实现。大量实验结果表明,G-VEval在与人类标注注释的相关性方面优于现有方法,分别使用Kendall tau-b和Kendall tau-c衡量。这为多样化的标题任务提供了灵活解决方案,并为大语言模型理解视频内容指明了方向,为自动化标题生成的进步铺平了道路。代码已公开:https://github.com/ztangaj/gveval

关键词

引用

@article{arxiv.2412.13647,
  title  = {G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o},
  author = {Tony Cheng Tong and Sirui He and Zhiwen Shao and Dit-Yan Yeung},
  journal= {arXiv preprint arXiv:2412.13647},
  year   = {2024}
}