SoundBeam:以声音类别标签与注册线索为条件提升目标声音提取性能并实现持续学习
音频与语音处理
2022-11-03 v2 声音
摘要
在许多情况下,我们希望听到期望的声音事件(SE),同时忽略干扰。目标声音提取(TSE)通过估计混合声音中目标 SE 类别的声音音频信号并抑制所有其他声音来解决此问题。我们可以使用一个神经网络,通过以代表目标 SE 类别的线索为条件来提取目标 SE。已有两类线索被提出,即目标 SE 类别标签和注册音频样本(或音频查询),后者是来自目标 SE 类别的声音的预录音频样本。基于 SE 类别标签的系统可以直接优化代表 SE 类别的嵌入向量,从而获得较高的提取性能。然而,将这些系统扩展至提取训练时未遇到的新 SE 类别并不容易。基于注册的方法通过在混合声音中寻找与注册音频样本具有相似特征的声音来提取 SE。这些方法不显式依赖 SE 类别定义,因此能够处理新的 SE 类别。本文中,我们引入了一个 TSE 框架 SoundBeam,它结合了两类方法的优势。我们还使用合成和真实混合声音对不同 TSE 方案进行了广泛评估,展示了 SoundBeam 的潜力。
引用
@article{arxiv.2204.03895,
title = {SoundBeam: Target sound extraction conditioned on sound-class labels and enrollment clues for increased performance and continuous learning},
author = {Marc Delcroix and Jorge Bennasar Vázquez and Tsubasa Ochiai and Keisuke Kinoshita and Yasunori Ohishi and Shoko Araki},
journal= {arXiv preprint arXiv:2204.03895},
year = {2022}
}
备注
Submitted to IEEE/ACM Trans. Audio, Speech, and Language Processing on Feb. 10th, 2022, and accepted on Oct. 20, 2022