中文

VCapsBench:面向视频字幕质量评估的大规模细粒度基准

计算机视觉与模式识别 2025-05-30 v1

摘要

视频字幕在文本到视频生成任务中起着至关重要的作用,其质量直接影响生成视频的语义连贯性和视觉保真度。尽管大型视觉语言模型(VLM)在字幕生成方面展现了巨大潜力,但现有基准未能充分解决细粒度评估问题,尤其是在捕捉对视频生成至关重要的时空细节方面。为弥补这一空白,我们引入了细粒度视频字幕评估基准(VCapsBench),这是首个大规模细粒度基准,包含 5,677(5K+)个视频和 109,796(100K+)个问答对。这些问答对在 21 个细粒度维度(例如摄像机运动和镜头类型)上进行了系统性标注,这些维度经实证证明对文本到视频生成至关重要。我们进一步引入了三个指标(准确率(AR)、不一致率(IR)、覆盖率(CR)),以及一个利用大型语言模型(LLM)通过对比问答对分析来验证字幕质量的自动化评估流程。通过为字幕优化提供可操作的见解,我们的基准能够促进稳健的文本到视频模型的发展。数据集和代码可在网站获取:https://github.com/GXYM/VCapsBench。

关键词

引用

@article{arxiv.2505.23484,
  title  = {VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation},
  author = {Shi-Xue Zhang and Hongfa Wang and Duojun Huang and Xin Li and Xiaobin Zhu and Xu-Cheng Yin},
  journal= {arXiv preprint arXiv:2505.23484},
  year   = {2025}
}

备注

submitting