中文

VidCapBench:用于可控文本到视频生成的视频标题综合基准

人工智能 2025-05-20 v2

摘要

可控文本到视频(T2V)模型的训练在很大程度上依赖于视频和标题之间的对齐,但现有研究很少将视频标题评估与 T2V 生成评估相联系。本文介绍了 VidCapBench,这是一个专为 T2V 生成设计的视频标题评估方案,独立于任何特定的标题格式。VidCapBench 采用一种数据标注管道,结合专家模型标注和人工校正,将每个收集的视频与其视频美学、内容、运动和物理法则等关键信息关联。VidCapBench 然后将这些关键信息属性划分为可自动评估和可手动评估的子集,满足敏捷开发的快速评估需求和严格验证的准确性要求。通过对众多最先进的标题模型进行评估,我们展示了 VidCapBench 在稳定性和全面性方面优于现有的视频标题评估方法。使用即插即用的 T2V 模型验证表明,VidCapBench 的评分与 T2V 质量评估指标之间存在显著正相关性,表明 VidCapBench 可为训练 T2V 模型提供有价值的指导。该项目可在 https://github.com/VidCapBench/VidCapBench 查看。

关键词

引用

@article{arxiv.2502.12782,
  title  = {VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation},
  author = {Xinlong Chen and Yuanxing Zhang and Chongling Rao and Yushuo Guan and Jiaheng Liu and Fuzheng Zhang and Chengru Song and Qiang Liu and Di Zhang and Tieniu Tan},
  journal= {arXiv preprint arXiv:2502.12782},
  year   = {2025}
}

备注

Accepted to Findings of ACL 2025