EVQAScore: 一种用于视频问答数据质量评估的细粒度指标
计算机视觉与模式识别
2025-02-07 v3 计算与语言
摘要
视频问答(QA)是视频理解中的核心任务。评估视频问答和视频字幕数据质量以训练视频大语言模型(VideoLLMs)是一项重要挑战。尽管已有多种方法被提出用于评估视频字幕质量,但目前仍缺乏专门针对视频问答的评估方法。为填补这一空白,我们提出了 EVQAScore,一种基于关键词提取的无参考方法,用于评估视频字幕和视频问答数据质量。此外,我们引入了帧采样与重缩放技术以提升评估的效率和鲁棒性,使我们的评分能够评估极长视频的质量。我们的方法在 VATEX-EVAL 视频字幕评估基准上取得了最先进的(SOTA)性能(Kendall 相关系数 32.8,Spearman 相关系数 42.3,比前人方法 PAC-S++ 分别高出 4.7 和 5.9)。此外,通过使用 EVQAScore 进行数据选择,我们仅使用原始数据量的 12.5% 就取得了 SOTA 结果,超越了前人 SOTA 方法 PAC-S 和使用 100% 数据的方法。
引用
@article{arxiv.2411.06908,
title = {EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation},
author = {Hao Liang and Zirong Chen and Hejun Dong and Wentao Zhang},
journal= {arXiv preprint arXiv:2411.06908},
year = {2025}
}