基于弱标记数据的源分离:一种计算听觉场景分析方法
声音
2020-02-07 v1 音频与语音处理
摘要
源分离是将一段音频录音分离为各个声源的任务。源分离是计算听觉场景分析的基础。以往关于源分离的工作集中于分离特定声音类别,如语音和音乐。许多先前工作需要有混合与干净源配对用于训练。本工作中,我们提出一种以弱标记数据训练的源分离框架。弱标记数据仅包含音频片段的标签,而不含声音事件的发生时间。我们首先用 AudioSet 训练一个声音事件检测系统。训练好的声音事件检测系统用于检测最有可能包含目标声音事件的片段。然后,从两个随机选取片段的混合到以目标片段的音频标记预测为条件的目标片段学习一个回归。我们提出的系统可在单一系统内从 AudioSet 分离 527 种声音类别。分离系统采用 U-Net,并在 AudioSet 的 527 种声音类别上取得平均 5.67 dB 的 SDR。
引用
@article{arxiv.2002.02065,
title = {Source separation with weakly labelled data: An approach to computational auditory scene analysis},
author = {Qiuqiang Kong and Yuxuan Wang and Xuchen Song and Yin Cao and Wenwu Wang and Mark D. Plumbley},
journal= {arXiv preprint arXiv:2002.02065},
year = {2020}
}
备注
5 pages