中文

基于弱标注数据查询式学习的零样本音频源分离

声音 2022-02-15 v4 人工智能 机器学习 多媒体 音频与语音处理

摘要

将音频分离为不同声源的深学习方法面临若干挑战。标准架构需为不同类型音频源训练独立模型。尽管某些通用分离器采用单一模型 targeting 多源,却难以泛化至未见源。本文提出一个三组件流程,从大规模但弱标注的数据集 AudioSet 训练通用音频源分离器。首先,我们提出基于 transformer 的声音事件检测系统以处理弱标注训练数据。其次,我们设计了一个查询式音频分离模型,利用该数据开展模型训练。第三,我们设计了潜嵌入处理器以编码指定分离目标的查询,从而实现零样本泛化。我们的方法使用单一模型进行多类声源分离,且仅依赖弱标注数据训练。此外,所提音频分离器可用于零样本设定,学会分离训练中从未见过的音频源类型。为评估分离性能,我们在 MUSDB18 上测试模型,同时在互不相交的 AudioSet 上训练。我们通过另一项对训练时留出音频源类型的实验进一步验证了零样本性能。在两种情形下,模型均取得与当前有监督模型可比的源失真比(SDR)性能。

关键词

引用

@article{arxiv.2112.07891,
  title  = {Zero-shot Audio Source Separation through Query-based Learning from Weakly-labeled Data},
  author = {Ke Chen and Xingjian Du and Bilei Zhu and Zejun Ma and Taylor Berg-Kirkpatrick and Shlomo Dubnov},
  journal= {arXiv preprint arXiv:2112.07891},
  year   = {2022}
}

备注

Preprint version for Association for the Advancement of Artificial Intelligence Conference, AAAI 2022