Diff-SAGe:基于扩散模型的端到端空间音频生成
声音
2025-07-16 v1 音频与语音处理
摘要
空间音频是创造沉浸式体验的关键组件。传统的仿真方法生成空间音频依赖专业知识,规模受限,假设语义信息与空间信息相互独立。为解决这些问题,我们探索了端到端空间音频生成。我们提出并定义了一种新的任务,即给定声音类别和声源空间位置生成一阶 Ambisonics(FOA)。我们提出 Diff-SAGe,一个用于该任务的端到端、基于流的扩散变换模型。Diff-SAGe 使用 FOA 的复频谱表示,保留对于准确空间线索至关重要的相位信息。此外,一个多条件编码器将输入条件整合为统一的表示,引导 FOA 波形从噪声生成。通过对两个数据集进行广泛评估,我们证明了该方法在客观和主观指标上 consistently 优于传统仿真基准方法。
关键词
引用
@article{arxiv.2410.11299,
title = {Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models},
author = {Saksham Singh Kushwaha and Jianbo Ma and Mark R. P. Thomas and Yapeng Tian and Avery Bruni},
journal= {arXiv preprint arXiv:2410.11299},
year = {2025}
}