EvalVerse: 专业电影级视频生成的管道感知与专家校准基准测试框架
计算机视觉与模式识别
2026-05-25 v1 人工智能
摘要
生成式视频基础模型的快速演进推动了该领域向专业级电影合成迈进。为实现如此严苛的质量,社区正向强化学习 (RL) 和智能体工作流程转变。然而,可靠的评估已成为关键瓶颈。现有基准主要评估“是否正确”(基础提示跟随),而根本忽略了“是否优秀”(电影质量、表演和审美)。此外,当前的自动化指标缺乏领域特定的严谨性,导致人类审美感知与机器评分之间存在严重的信任差距。为弥合这一差距,我们提出 EvalVerse,一个全面、管道感知且专家校准的评估框架。我们将视频生成评估不仅视为工程任务,更视为核心科学问题:主观电影专业知识的系统化数字化。首先,我们将领域知识整合到与专业电影制作工作流程(前期、制作、后期)对齐的评估分类学中。其次,我们从人类专家判断中提炼出精选数据集,包含大规模人类标注。最后,我们通过专家校准的微调策略将这些知识注入视觉语言模型 (VLM),使其能够进行显式的链式思考推理。与前述工作相比,EvalVerse不仅保留了基础“正确性”指标的兼容性,还显著扩展了“优秀性”标准,扩大了任务覆盖范围到复杂的多镜头序列和音视频集成。因此,凭借提供的细粒度诊断信号,EvalVerse超越了静态排行榜,为未来工作(如奖励模型和评估器智能体)建立了基本基础设施。
引用
@article{arxiv.2605.23271,
title = {EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation},
author = {Songlin Yang and Haobin Zhong and Ruilin Zhang and Xiaotong Zhao and Shuai Li and Kai Zheng and Xuyi Yang and Zhe Wang and Zhenchen Tang and Yang Li and Bohai Gu and Zhengwei Peng and Yidan Huang and Mengzhou Luo and Yihang Bo and Dalu Feng and Yujia Zhang and Juntao Ma and Ruiqi Wang and Lvmin Zhang and Yuwei Guo and Frank Guan and Maneesh Agrawala and Hongbo Fu and Alan Zhao and Anyi Rao},
journal= {arXiv preprint arXiv:2605.23271},
year = {2026}
}