中文

利用弱标记数据的通用声源分离

声音 2023-05-15 v1 音频与语音处理

摘要

通用声源分离(USS)是计算听觉场景分析的基础研究任务,旨在将单声道录音分离为独立的声源轨。音频声源分离任务有待解决三个潜在挑战。首先,以往的音频声源分离系统主要聚焦于分离一种或有限数量的特定声源,缺乏构建可通过单一模型分离任意声源的统一系统的研究。其次,大多数以往系统需要干净声源数据来训练分离器,而干净声源数据稀缺。第三,缺乏能够在层级上自动检测并分离活跃声音类别的USS系统。为利用大规模弱标记/无标记音频数据进行音频声源分离,我们提出一个通用音频声源分离框架,包含:1)在弱标记数据上训练的音频标注模型作为查询网络;2)以查询网络输出为条件分离任意声源的条件声源分离模型。我们研究了多种查询网络、声源分离模型及训练策略,并提出层级USS策略以从AudioSet本体自动检测并分离声音类别。仅借助弱标记的AudioSet,我们的USS系统成功分离了广泛的声音类别,包括声音事件分离、音乐源分离和语音增强。该USS系统在AudioSet的527个声音类别上取得平均信号失真比改善(SDRi)5.57 dB;在DCASE 2018 Task 2数据集上10.57 dB;在MUSDB18数据集上8.12 dB;在Slakh2100数据集上SDRi 7.28 dB;在voicebank-demand数据集上SSNR 9.00 dB。我们在https://github.com/bytedance/uss发布源代码。

关键词

引用

@article{arxiv.2305.07447,
  title  = {Universal Source Separation with Weakly Labelled Data},
  author = {Qiuqiang Kong and Ke Chen and Haohe Liu and Xingjian Du and Taylor Berg-Kirkpatrick and Shlomo Dubnov and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:2305.07447},
  year   = {2023}
}