中文

任意声音的一次性条件音频滤波

音频与语音处理 2020-11-05 v1

摘要

我们考虑基于仅有的目标声源短样本,从单通道混合中分离特定声源的问题。利用 SoundFilter(一种波到波的神经网络架构),我们可在不使用任何声音类别标签的情况下训练模型。通过使用与源分离网络联合学习的条件编码器模型,训练后的模型可被“配置”以滤波任意声源,甚至是训练期间未见过者。在 FSD50k 数据集上评估,我们的模型对两种声音的混合取得 9.6 dB 的 SI-SDR 提升。当在 Librispeech 上训练时,我们的模型在从两个说话人混合中分离一个语音时取得 14.0 dB 的 SI-SDR 提升。此外,我们展示条件编码器学到的表征在嵌入空间中将声学相似的声音聚在一起,尽管其训练未使用任何标签。

关键词

引用

@article{arxiv.2011.02421,
  title  = {One-shot conditional audio filtering of arbitrary sounds},
  author = {Beat Gfeller and Dominik Roblek and Marco Tagliasacchi},
  journal= {arXiv preprint arXiv:2011.02421},
  year   = {2020}
}