中文

DualSpec:基于双谱图引导的文本到空间音频生成

声音 2025-06-09 v2 人工智能 音频与语音处理

摘要

文本到音频(TTA)技术通过文本描述生成音频信号,近年来受到广泛关注。然而,近期工作仅关注文本到单声道音频。众所周知,空间音频比单声道音频提供更沉浸式的听觉体验,例如在虚拟现实中。为此,我们提出一种名为 DualSpec 的文本到空间音频(TTSA)生成框架。具体而言,它首先为提取声音事件音频的潜在声学表征训练变分自编码器(VAE)。随后,给定描述声音事件及其方向的文本,所提出的方法使用预训练大语言模型的编码器将文本转换为文本特征。最后,训练从潜在声学表征和文本特征中进行空间音频生成的扩散模型。在推理阶段,仅需文本描述即可生成空间音频。特别地,为同时提高合成质量和空间声音事件的方位精度,我们提出使用两种声学特征:一种是 Mel 频谱图,在提高合成质量方面效果更好;另一种是短时傅里叶变换频谱图,在提高方位精度方面效果更好。我们提供构建带文本提示的空间音频数据集的管道,用于训练 VAE 和扩散模型。我们还引入新的空间感知评估指标来量化生成空间音频录音的方位误差。实验结果表明,所提出的方法能够生成在方向和事件一致性方面表现优异的空间音频。

关键词

引用

@article{arxiv.2502.18952,
  title  = {DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model},
  author = {Lei Zhao and Sizhou Chen and Linfeng Feng and Jichao Zhang and Xiao-Lei Zhang and Chi Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2502.18952},
  year   = {2025}
}