FoleyBench:用于视频到音频模型的基准测试
声音
2025-11-25 v2 人工智能
音频与语音处理
摘要
视频转音频生成(V2A)在电影后期制作、AR/VR 和声音设计等领域日益重要,尤其是用于创建与屏幕动作同步的Foley音效。Foley需要生成既与可见事件语义对齐又与其时间对齐的音频。然而,由于缺乏专为Foley场景设计的基准测试,评估方法与下游应用之间存在不匹配。我们发现,过去评估数据集中的74%视频文件音画对应性较差。此外,这些数据集以语音和音乐为主,这些领域不符合Foley的使用场景。为解决这一问题,我们引入FoleyBench——第一个专为Foley风格V2A评估设计的大规模基准测试。FoleyBench包含5000组(视频、ground-truth音频、文本描述)三元组,每组均包含与屏幕事件在因果上相连的音频源。该数据集通过自动化、可扩展的管道从YouTube和Vimeo等网络视频中构建。与过去的数据集相比,FoleyBench的视频在专为Foley音效设计的分类法下,覆盖了更广泛的声音类别。每个剪辑还标注了元数据,包括源复杂度、UCS/AudioSet类别和视频长度,支持对模型性能和失效模式进行细粒度分析。我们对多种最新V2A模型进行基准测试,评估其在音频质量、音画对齐、时间同步和音文本一致性方面的表现。样本可在 https://gclef-cmu.org/foleybench 查阅。
引用
@article{arxiv.2511.13219,
title = {FoleyBench: A Benchmark For Video-to-Audio Models},
author = {Satvik Dixit and Koichi Saito and Zhi Zhong and Yuki Mitsufuji and Chris Donahue},
journal= {arXiv preprint arXiv:2511.13219},
year = {2025}
}