MTAVG-Bench 2.0:诊断多说人音视频生成中电影化表达失效模式
人工智能
2026-05-28 v1 多媒体
声音
摘要
近年来,多说人音视频生成(MTAVG)模型在诸如同步 lip 和音视频对齐等基本指标方面表现出色。然而,这些指标对于评估场景级生成的电影化表达仍不足。 在多角色场景中,生成模型必须超越音视频逼真度,才能传递连贯的角色表现以及其他更高层次的电影质量。为填补这一差距,我们引入MTAVG-Bench 2.0,用于诊断多说人音视频生成中电影化表达的失效模式。与之前主要关注基本多轮对话质量的设置不同,MTAVG-Bench 2.0面向短剧和场景级生成,建立了涵盖表演、叙事、氛围和音视频语言的高层次失效分类法。基于此分类法,我们构建了超过10,000个问答评估实例,包括用于短剧级评估和失效模式的时间局部化子集,以系统评估大型语言模型诊断高层次音视频失效的能力。实验结果表明,像Gemini这样的商业全能模型在其他评估器中显著优于其他模型,然而即使是最强的模型在本基准测试中仍在处理复杂失效方面存在挑战。这些结果表明,MTAVG-Bench 2.0为多说人音视频生成中的失效诊断提供了系统性的基准测试框架。
引用
@article{arxiv.2605.28035,
title = {MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation},
author = {Haitian Li and Yanghao Zhou and Heyan Huang and Liangji Chen and YiMing Cheng and Xu Liu and Dian Jin and Jiajun Xu and Jingyun Liao and Tian Lan and Ziqin Zhou and Yueying Liu and Yu Bai and Changsen Yuan and Jinxing Zhou and Xian-Ling Mao and Xuefeng Chen and Yousheng Feng},
journal= {arXiv preprint arXiv:2605.28035},
year = {2026}
}