中文

VidAudio-Bench:面向 V2A 与 VT2A 生成的四类音频基准

声音 2026-04-14 v1 人工智能

摘要

视频到音频(V2A)生成对于沉浸式多媒体体验至关重要,但其评估仍未得到充分关注。现有基准通常在统一的协议下评估多样化音频类型,忽视了不同音频类别的细粒度需求。为此,我们提出 VidAudio-Bench,一个具有四大特征的多任务 V2A 评估基准:(1)广泛覆盖:涵盖声效、音乐、语音和歌唱四类具代表性的音频类别,分别在 V2A 和 Video-Text-to-Audio(VT2A)设置下;(2) extensive 评估:包含 1,634 对视频文本对,基准测试 11 个最先进的生成模型;(3)全面指标:引入 13 个任务专用的、无参考指标,系统性评估音频质量、视频音频一致性和文本音频一致性;(4)人类对齐:通过主观研究验证所有指标,表明其与人类偏好高度一致。实验结果揭示,当前 V2A 模型在语音和歌唱方面表现不佳,仅在声效方面表现较好。我们的 VT2A 结果进一步凸显了指令遵循与视觉导向生成之间根本的张力:更强的视觉条件可提高视频音频对齐,但往往以牺牲生成预期音频类别为代价。这些发现使 VidAudio-Bench 成为诊断 V2A 系统的全面且可扩展框架,并为多模态音频生成提供了新视角。

关键词

引用

@article{arxiv.2604.10542,
  title  = {VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories},
  author = {Qian Zhang and Yuqin Cao and Yixuan Gao and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2604.10542},
  year   = {2026}
}