中文

SoloAudio:基于面向语言的音频扩散 Transformer 的目标声音提取

音频与语音处理 2025-01-03 v2 声音

摘要

在本文中,我们介绍了 SoloAudio,一种用于目标声音提取(TSE)的新型基于扩散的生成模型。我们的方法在音频上训练潜在扩散模型,用作用于潜在特征的带跳跃连接的 Transformer 替换了以往的 U-Net 骨干网络。SoloAudio 通过使用 CLAP 模型作为目标声音的特征提取器,同时支持面向音频和面向语言的 TSE。此外,SoloAudio 利用最先进的文本到音频模型生成的合成音频进行训练,展现了对域外数据和未见声音事件的强泛化能力。我们在 FSD Kaggle 2018 混合数据集和来自 AudioSet 的真实数据上评估了该方法,其中 SoloAudio 在域内和域外数据上均取得了 state-of-the-art 的结果,并展现出出色的 zero-shot 和 few-shot 能力。源代码和演示已发布。

关键词

引用

@article{arxiv.2409.08425,
  title  = {SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer},
  author = {Helin Wang and Jiarui Hai and Yen-Ju Lu and Karan Thakkar and Mounya Elhilali and Najim Dehak},
  journal= {arXiv preprint arXiv:2409.08425},
  year   = {2025}
}

备注

Submitted to ICASSP 2025