中文

分离你所描述的任何声音

音频与语音处理 2024-12-03 v3 人工智能 多媒体 声音

摘要

语言查询音频源分离(LASS)是计算听觉场景分析(CASA)的一种新范式。LASS旨在给定自然语言查询的条件下,从音频混合中分离出目标声音,这为数字音频应用提供了自然且可扩展的接口。近期关于LASS的研究尽管在特定声源(如乐器、有限类别的音频事件)上取得了有前景的分离性能,却无法分离开放域中的音频概念。在本工作中,我们引入AudioSep,一种支持自然语言查询的开放域音频源分离基础模型。我们在大规模多模态数据集上训练AudioSep,并在包括音频事件分离、乐器分离和语音增强在内的众多任务上广泛评估其能力。AudioSep展现出强大的分离性能以及使用音频描述或文本标签作为查询的卓越零样本泛化能力,大幅优于以往的音频查询与语言查询声音分离模型。为复现本工作,我们将在 https://github.com/Audio-AGI/AudioSep 发布源代码、评估基准与预训练模型。

关键词

引用

@article{arxiv.2308.05037,
  title  = {Separate Anything You Describe},
  author = {Xubo Liu and Qiuqiang Kong and Yan Zhao and Haohe Liu and Yi Yuan and Yuzhuo Liu and Rui Xia and Yuxuan Wang and Mark D. Plumbley and Wenwu Wang},
  journal= {arXiv preprint arXiv:2308.05037},
  year   = {2024}
}

备注

Code, benchmark and pre-trained models: https://github.com/Audio-AGI/AudioSep