QEVA:基于多模态问答的叙事视频摘要参考自由评估指标
计算机视觉与模式识别
2026-04-28 v1 人工智能
摘要
视频到文本摘要在综合评估方法方面仍受到忽视。传统的n-gram重叠基于指标和最近的大型语言模型(LLM)方法高度依赖人工编写的参考摘要,限制了其实用性和对细微语义方面的敏感性。本文提出了QEVA,通过多模态问答直接对候选摘要与源视频进行评估,实现一种参考自由的评估指标。QEVA沿着三个清晰的维度评估摘要:覆盖性、事实性和时间性。我们还引入了MLVU(VS)-Eval,一个新构建的注释基准数据集,源自MLVU数据集,包含800个摘要,来自200个视频,使用最先进的视频语言多模态模型生成。该数据集建立了一个透明且一致的评估框架。实验结果表明,QEVA的相关性在Kendall的、和Spearman的方面高于现有方法,表明其更能反映人类判断。我们希望我们的基准和指标将促进视频到文本摘要研究的有意义进展,并为开发未来评估方法提供宝贵见解。
引用
@article{arxiv.2604.24052,
title = {QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering},
author = {Woojun Jung and Junyeong Kim},
journal= {arXiv preprint arXiv:2604.24052},
year = {2026}
}
备注
Accepted to Findings of EMNLP 2025