中文

SpatialV2A:基于视觉引导的高保真空间音频生成

计算机视觉与模式识别 2026-01-30 v2

摘要

虽然视频到音频生成在语义和时间对齐方面取得了显著进展,但大多数现有研究仅关注这些方面,忽略了合成音频的空间感知和沉浸式质量。这种局限性主要源于当前模型依赖单声道音频数据集,缺乏用于学习视觉到空间音频映射的全向空间信息。为填补这一差距,我们提出了两个关键贡献:构建 BinauralVGGSound——首个大规模视频-全向音频数据集,以支持空间感知的视频到音频生成;提出一种基于视觉线索的端到端空间音频生成框架,显式建模空间特征。我们的框架包含视觉引导的音频空间化模块,确保生成的音频在保持语义和时间对齐的同时,呈现真实的空间属性和分层空间深度。实验表明,我们的方法在空间保真性方面显著优于最先进的模型,提供更沉浸式的听觉体验,且不牺牲时间或语义一致性。演示页面可访问于 https://github.com/renlinjie868-web/SpatialV2A。

关键词

引用

@article{arxiv.2601.15017,
  title  = {SpatialV2A: Visual-Guided High-fidelity Spatial Audio Generation},
  author = {Yanan Wang and Linjie Ren and Zihao Li and Junyi Wang and Tian Gan},
  journal= {arXiv preprint arXiv:2601.15017},
  year   = {2026}
}