AudioSpa:基于文本的空间化声音事件
音频与语音处理
2025-02-18 v1 声音
摘要
文本到音频(TTA)系统最近在合成单声道音频方面表现出色,但尚未探索从文本生成全向空间音频的任务——这提供了更沉浸式的听觉体验,通过融合空间感知。本文介绍了受文本引导的全向音频生成方法。作为早期工作,我们聚焦于额外提供单声道参考音频的场景。核心问题在于将特定声音事件与其方向关联,从而创建全向空间音频。挑战在于文本描述的复杂性以及单源声音事件数据稀缺。为此,我们提出了 AudioSpa 模型,该模型应用大语言模型处理声学和文本信息。我们采用融合多头注意力(FMHA)整合文本标记,增强了多模态学习的生成能力。此外,我们提出了全向源定位模型,用于评估生成音频的质量。最后,我们设计了数据增强策略以生成多样化数据集,使模型能够在各种空间位置对声音事件进行空间化。实验结果表明,模型能够准确地将声音置于指定位置。在局部化精度和信号失真方面实现了竞争性能。我们的演示可在 https://linfeng-feng.github.io/AudioSpa-demo 查看。
引用
@article{arxiv.2502.11219,
title = {AudioSpa: Spatializing Sound Events with Text},
author = {Linfeng Feng and Lei Zhao and Boyu Zhu and Xiao-Lei Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2502.11219},
year = {2025}
}