中文

基于潜在扩散模型的移动3D声景生成

声音 2025-09-22 v2 人工智能 音频与语音处理

摘要

空间音频已成为沉浸式应用(如VR/AR、电影和音乐)的核心内容。现有生成式音频模型主要局限于单声道或立体声格式,无法捕捉一阶Ambisonics(FOA)中可用的所有3D定位线索。最近的FOA模型扩展了文本到音频生成,但仍受限于静态声源。本文引入SonicMotion,即首个能够生成带有对移动声源显式控制的FOA音频的端到端潜在扩散框架。SonicMotion有两种变体:1)基于自然语言提示的描述模型,2)基于文本和空间轨迹参数的参数组合模型,以实现更高精度。为支持训练和评估,我们构建了一个包含100万以上模拟FOA描述对的新数据集,这些描述对包括静态和动态声源,并标注了方位、仰角和运动属性。实验表明,SonicMotion在语义对齐方面实现了最先进的水平,在感知质量上相当于领先的文本到音频系统,同时独特地实现了低的空间定位误差。

关键词

引用

@article{arxiv.2507.07318,
  title  = {Generating Moving 3D Soundscapes with Latent Diffusion Models},
  author = {Christian Templin and Yanda Zhu and Hao Wang},
  journal= {arXiv preprint arXiv:2507.07318},
  year   = {2025}
}