中文

SAVGBench:空间对齐的音视频生成基准测试

声音 2026-02-05 v2 多媒体 音频与语音处理

摘要

本研究解决了多模态生成模型在生成具有空间对齐音频的高质量视频方面能力不足的问题。尽管生成模型近期在视频生成领域取得了成功,但它们往往忽视了音频与视觉内容之间的空间对齐,而这对于沉浸式体验至关重要。为解决这一问题,我们在空间对齐的音视频生成(SAVG)任务的基准测试中确立了一个新的研究方向。我们引入了一个空间对齐的视听数据集,其音频和视频数据根据声音事件是否出现在屏幕内进行了筛选。我们还提出了一种新的对齐指标,旨在评估音频与视频之间的空间对齐情况。随后,利用该数据集和指标,我们对两类基线方法进行了基准测试:一类基于联合音视频生成模型,另一类是结合了视频生成模型和视频到音频生成模型的两阶段方法。我们的实验结果表明,这些基线方法在视频和音频质量以及两种模态之间的空间对齐方面,均与真实数据存在差距。

关键词

引用

@article{arxiv.2412.13462,
  title  = {SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation},
  author = {Kazuki Shimada and Christian Simon and Takashi Shibuya and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2412.13462},
  year   = {2026}
}

备注

5 pages, 2 figures, accepted for publication in IEEE ICASSP 2026