VABench:用于音频-视频生成的综合基准
计算机视觉与模式识别
2026-04-07 v2 声音
摘要
近期视频生成技术取得了显著进展,使模型能够生成视觉上引人注目的视频并实现音频同步。虽然现有视频生成基准提供了针对视觉质量的全面指标,但缺乏对音频-视频生成的说服性评估,尤其是针对旨在生成同步音频-视频输出的模型。为此,本文引入VABench,一个全面且多维度的基准框架,旨在系统性评估同步音频-视频生成的能力。VABench涵盖三种主要任务类型:文本到音频-视频(T2AV)、图像到音频-视频(I2AV)和立体声音频-视频生成。进一步建立两个主要评估模块,涵盖15个维度。这些维度特别评估文本-视频、文本-音频、视频-音频的两两相似性、音频-视频同步、唇语-语音一致性以及精心策划的音频和视频问答(QA)配对等。此外,VABench覆盖七大内容类别:动物、人类声音、音乐、环境声、同步物理声、复杂场景和虚拟世界。我们提供该评估结果的系统性分析与可视化,旨在建立新的标准来评估具备同步音频能力的视频生成模型,并推动该领域的全面发展。
引用
@article{arxiv.2512.09299,
title = {VABench: A Comprehensive Benchmark for Audio-Video Generation},
author = {Daili Hua and Xizhi Wang and Bohan Zeng and Xinyi Huang and Hao Liang and Junbo Niu and Xinlong Chen and Quanqing Xu and Wentao Zhang},
journal= {arXiv preprint arXiv:2512.09299},
year = {2026}
}
备注
24 pages, 25 figures