中文

MSAVBench:迈向多镜头音视频生成的全面可靠评估

计算机视觉与模式识别 2026-05-20 v1

摘要

视频生成正从单镜头合成迅速演进至复杂的多镜头音视频(MSAV)叙事,以满足现实世界需求。然而,评估此类前沿模型仍是一项根本性挑战。现有基准在范围和数据多样性上存在局限,且依赖僵化的评估流程,无法对现代 MSAV 模型进行系统且可靠的评估。为弥合这些差距,我们引入了 MSAVBench,这是首个用于多镜头音视频生成的全面基准及自适应混合评估框架。我们的基准涵盖视频、音频、镜头和参考四个关键维度,覆盖多样化的任务设置、最多 15 个的不同镜头数量以及具有挑战性的非真实场景。我们的评估框架通过用于镜头分割的自适应自校正机制、用于主观指标的实例化评分细则,以及用于复杂判断的基于工具的证据提取,提升了鲁棒性。此外,MSAVBench 与人类判断实现了高度一致,斯皮尔曼等级相关系数达到 91.5%。我们对 19 个最先进的闭源和开源模型进行的系统评估表明,当前系统在导演级控制和细粒度音视频同步方面仍存在困难,而模块化或智能体式生成流程为缩小开源与闭源模型之间的差距提供了一条有前景的路径。我们将发布基准数据和评估代码,以促进未来研究。

关键词

引用

@article{arxiv.2605.20183,
  title  = {MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation},
  author = {Yujie Wei and Yujin Han and Zhekai Chen and Yongming Li and Kaixun Jiang and Zhihang Liu and Quanhao Li and Zhiwu Qing and Xiang Wang and Zhen Xing and Ruihang Chu and Lingyi Hong and Yefei He and Junjie Zhou and Junqiu Yu and Yang Shi and Difan Zou and Kai Zhu and Shiwei Zhang and Yingya Zhang and Yu Liu and Xihui Liu and Hongming Shan},
  journal= {arXiv preprint arXiv:2605.20183},
  year   = {2026}
}